MiniMax 發布通用型多模態生成模型 H3,這是一款能夠理解文字、影像、視訊和音訊之間的統一上下文,產生具有原生立體聲的視頻,解析度可達15秒。
H3 已準備好用於各種應用場景的商業內容創作,在指令執行、精準的文本和品牌渲染以及 V2V 動態傳輸方面表現出色。憑藉精準可控的多模態生成和編輯功能,H3 專為廣告、品牌推廣、電子商務、產品設計、UI/UX 設計、遊戲等領域而打造。
H3 採用包括上下文全向表示 (Contextual Omni Representation)、H3-VAE、H3-Omni Transformer 和上下文內重現 (In-Context Regeneration) 在內的多項技術,提供業界領先的性價比。在 2K 解析度下,H3 的每秒價格不到主流機型的三分之一;在 768p 解析度下,其價格不到主流機型 720p 解析度價格的一半。
https://x.com/MiniMax_AI/status/2083008095488516262
Picture Source
MiniMax

留言
張貼留言