MiniMax kompaniyasi HuggingFace platformasida ochiq kodli H3-Base modelining vaznlarini taqdim etdi. Ushbu model 33 milliard parametrli zich, bitta yo'nalishli Omni-Transformer bo'lib, u 16 barobar makoniy va 4 barobar vaqtinchalik siqishga ega VAE bilan jihozlangan. Shu bilan birga, API orqali foydalanish xarajatlari Seedance 2.0 narxining uchdan biri miqdorida.
H3 modelining afzalligi shundaki, u faqat matndan videoga yoki tasvirdan videoga aylantirish uchun mo'ljallangan modellardan farqli o'laroq, barcha modalitetlarni yaratuvchi universal tizimdir. U matn, tasvir, video va audio kontekstlarini tushunishi va keyin tabiiy stereosound bilan video yaratishi mumkin. Arxitektura jihatidan, H3 video va audio modellarining ketma-ket bog'lanishi emas.
Asosiy tarmoq, H3-Omni-Transformer, 33 milliard parametrli zich, bitta yo'nalishli Transformer sifatida amalga oshirilgan, bunda taxminan 13 milliard parametr AdaLN shoxchasida joylashgan va uning modulatsiya natijalari yanada yengil inferens uchun oldindan hisoblab saqlanishi mumkin. Matnni kodlash H3-Encoder tomonidan, vizual ma'lumotlar H3-Encoder va H3-VisualVAE tomonidan, audio esa H3-AudioVAE tomonidan bajariladi; bularning barchasi video va audio latentlari uchun birgalikda bashorat qilinadigan yagona ketma-likka integratsiya qilingan.
MiniMax H3-VisualVAE ni 16 barobar makoniy siqish va 4 barobar vaqtinchalik siqishni joriy etish orqali takomillashtirdi. Qo'shimcha patchlashdan so'ng, Transformerga kiruvchi video tokenlarining samarali makoniy aniqligini pasaytirish 32 baravar darajaga yetadi, bu yuqori aniqlikdagi video yaratishdagi hisoblash xarajatlarini kamaytiradi. MiniMax H3 ning to'liq tarkibi uchta komponentdan iborat: H3-Context-IR, H3-Base va H3-Regenerate-2K. H3-Context-IR foydalanuvchi tomonidan taqdim etilgan matn, tasvirlar, videolar va audioni talqin qiladi, murakkab multimodal ko'rsatmalarni generativ modellar uchun mos keladigan vositachilar bayonotlariga tuzadi. H3-Base haqiqiy video va audio yaratish uchun javobgar bo'lib, dastlabki chiqish 768P aniqligida amalga oshiriladi. H3-Regenerate-2K komponenti asl kontekstni saqlagan holda 768P natijasidan 2K versiyasini olish uchun kontekstda qayta tiklashdan foydalanadi. Hozirda H3-Base komponenti ochiq vaznlarga ega.
Narx siyosati H3 ni bozorni o'zgartiruvchi muhim omilga aylantiradi: 2K aniqligida yaratish sekundiga 0,8 yuan, 768P aniqligida esa arzonroq, shu bilan birga audio kiritish bepul va besh tagacha tasvir bepul beriladi. Ishlash nuqtai nazaridan, H3 ByteDance ning Seedance 2.0 ga nisbatan uchdan bir qismi narxda raqobatbardoshlikni namoyish etadi, va ikki dona RTX 5090 yoki bitta RTX 6000 kartalarda mahalliy joylashtirish xarajatlarni nolga tushiradi. Flagman imkoniyatlari, maqbul narx va ochiq vaznlari tufayli, video yaratish tashabbusi har bir ishlab chiquvchiga mavjud bo'ladi.
Ushbu modelni chiqarish sun'iy intellekt yordamida video yaratish bozoridagi raqobatni kuchaytiradi. Seedance 2.0 avval audio va video birlashtirilgan yaratilishi tufayli ustunlik qilgan edi, va MiniMax H3 bevosita shu o'rinni egallashni maqsad qilgan, sezilarli darajada kamroq xarajatlar bilan teng funksionallikni taklif qiladi. Kontent yaratuvchilar va ishlab chiquvchilar uchun H3 yopiq platformalarda mavjud bo'lmagan moslashuvchanlikni taqdim etadi, jumladan, ma'lumotlarga sezgir ish jarayonlari uchun mahalliy joylashtirish, foydalanuvchi maxsus sozlamalar va mavjud ishlab chiqarish liniyalari bilan integratsiya qilish imkoniyati. Ochiq vaznlar strategiyasi Xitoy AI kompaniyalari yopiq ekotizimlarga qarshi kurash uchun ochiq kod va agressiv narxlashdan foydalanishi kabi global tendentsiyaga mos keladi. Shunday qilib, H3 AI yordamida video yaratish iqtisodiyotini qayta ko'rib chiqadi, ilg'or video modellarining qimmat bulutli xizmatlar bo'lishi kerak degan farazga qarshi turadi va reklama, elektron tijorat, kino ishlab chiqarish va kontent yaratishda qo'llanilishni potentsial ravishda tezlashtiradi, bu yerda avval foydalanish narxga sezgirlik bilan cheklangan edi.