国产世界模型新突破:MoWorld-3D以三成成本实现物理交互

图片只作辅助表达,并非真实画面,由 AI 生成
资讯来源:互联网公开资料整合

7月16日,杭州迎来一场AI领域的重要发布——国家人工智能应用中试基地(具身智能)携手华为、魔芯科技,正式推出MoWorld-3D交互式三维世界模型。该模型全栈基于昇腾NPU构建,以28B参数MoE架构运行,推理综合成本仅为同等规模进口GPU方案的30%,为空间智能的规模化落地提供了高性价比的算力支撑。

与市面上主流的视频生成模型不同,MoWorld-3D的核心竞争力在于'物理可交互'。用户通过图像或文本输入,即可生成符合真实空间规律的三维场景,并借助相机六自由度运动信号在虚拟世界中自由行走、环绕观测。这一能力源于魔芯科技与昇腾AI长达一年多的底层联合创新——双方围绕多NPU协同调度、注意力计算轻量化、生成算子融合等环节进行系统性改造,将场景解码与主干生成任务拆分至多卡并行执行,大幅削减显存冗余与无效计算。

从产业视角看,MoWorld-3D的落地恰逢行业转型关键期。过去,工业机器人掌握抓取、避障等动作需在真实产线中反复试错,设备损耗与安全隐患突出;如今,依托该模型搭建的数字仿真训练场,所有动作演练均可在虚拟空间高频次迭代,将试错成本从物理世界转移至算力集群。魔芯科技自2021年成立以来,持续深耕4D动态世界基座大模型,2025年底已完成交互式视频世界模型原型验证,此次发布标志着国产世界模型从实验室走向规模化应用的重要跨越。业内普遍认为,2026年将是世界模型从概念验证走向产业落地的元年,而全栈自研的算力底座正成为这一进程的关键变量。

浏览 16620 · 资讯ID: 23088

返回首页

相关问题

MoWorld-3D与普通视频生成模型的核心区别是什么?
普通视频模型侧重影视创作,而MoWorld-3D支持用户以图像或文本输入生成三维场景,并通过相机六自由度运动实现行走、转身等实时物理交互,场景结构严格贴合真实空间规律。
MoWorld-3D如何实现低成本优势?
其推理成本仅为同等规模进口GPU方案的30%,主要得益于魔芯科技与昇腾AI的深度联合创新,包括多NPU协同调度、注意力计算轻量化、混合精度量化及生成算子融合等底层优化。
该模型对具身智能产业有何实际价值?
它为机器人提供了虚拟仿真训练场,使抓取、避障等动作演练可在虚拟空间高频次复盘,避免真实环境中的设备损耗与安全隐患,大幅降低训练门槛与试错成本。
标签: AI 人工智能 娱乐

评论 (0)

暂无评论,快来抢沙发吧!