视频生成赛道迎来标志性事件:MiniMax于7月31日发布旗舰模型H3,并在8月3日全面开放权重。这款通用视频模型能同时理解文字、图像、音频与视频素材,输出最长15秒、2K分辨率且带原生双声道声音的动态内容。从创作者实测看,H3在电影预告、动态海报、游戏UI动效及商业广告等场景均有不俗表现,并可对既有视频进行字幕添加与特效包装,贴近企业真实生产需求。
H3的开源引发行业震动,其能力被拿来与字节跳动的Seedance 2.5直接对标。在复杂文字渲染与UI动效生成上,H3展现出优势——模型能理解文字与画面的逻辑关联,而非简单叠加元素。硅谷风投a16z合伙人Justine Moore的测试颇具说服力:她要求模型生成人物在黑板上书写'Hi'的画面,此前所有模型均告失败,H3首次成功。截至8月2日,H3在带声音文生视频榜单位列第二,视频编辑榜单登顶。这背后折射出中美AI路线的分化:美国头部公司倾向以API保护旗舰模型权重,而中国玩家如DeepSeek、阿里、MiniMax则选择开放权重以构建生态。
开放权重意味着企业可自主部署模型、用自有数据微调,摆脱对闭源厂商价格与规则的依赖。但开源只是起点,视频模型的高算力需求与部署成本仍是现实门槛。从行业趋势看,中国模型公司的开源探索正从语言模型延伸至视频领域,H3能否成为'视频界的DeepSeek',取决于生态伙伴能否协同降低使用门槛,让开源价值真正落地。
暂无评论,快来抢沙发吧!