具身智能领域正面临一个全球性的核心瓶颈:如何获取大规模且高质量的真实世界交互数据。灵初智能联合创始人陈源培在近期的一场科技演讲中深入剖析了这一痛点,并分享了公司基于人类操作数据构建具身灵巧操作通用模型的技术路径。该方案旨在通过规模化采集真实人类行为数据,训练通用操作基座模型,从而攻克机器人操作中节拍、成功率与精度难以兼顾的“不可能三角”,并优先在物流这一半结构化场景中实现商业化突破。
回顾机器人操作技术的发展,非标自动化时代依赖预设轨迹,虽精度高但泛化能力弱,新场景部署需耗费数月调试;视觉结合运动拟合方案虽有所进步,但仍距通用模型有差距;而当前主流的端到端伺服控制路线虽依赖数据驱动,却难以调和性能三角矛盾。与拥有海量文本语料的大语言模型或持续回流驾驶数据的自动驾驶不同,具身智能所需的精细交互数据极为稀缺,这成为制约行业发展的关键因素。
针对数据路线的选择,业界通常考虑互联网视频、真机示教、仿真合成及人类操作数据四类。互联网视频信噪比低,提取成本高;仿真数据虽可扩展,但难以应对全新物体与场景,且资产重建成本高昂;真机数据质量最高但总量不足。灵初智能最终聚焦于人类操作数据,因为灵巧手与人手的行为鸿沟最小,能高效利用日常操作数据。公司自研了涵盖灵巧手、数据采集终端的全套硬件体系,并于今年4月发布了首版人类数据驱动的基座模型框架。
该模型架构由两大核心模块组成:Psi-R2作为策略网络(World Action Model),接收环境观测并输出动作指令;Psi-W0作为动作条件世界模型,基于包含大量失败样本的人类数据训练,负责评估与仿真。两者的创新结合在于通过强化学习打通链路,形成闭环。Psi-R2在Psi-W0内部进行推演,收集成功样本并过滤失败数据,生成增量数据集回流训练。这种机制不仅解决了人类与机器人本体构型差异带来的偏差,还能将人类演示轨迹转化为物理层面可执行的机器人指令,同时兼具数据评估器功能。
在数据采集环节,灵初智能采用了轻量化外骨骼结构,旨在最小化对工作人员日常作业的干扰。相比雇佣专职采集员,让真实在岗人员佩戴设备采集,不仅大幅降低成本,更能确保数据贴合真实业务节奏。公司的落地战略明确区分了训练与采集:模型训练在公司内部完成,而数据采集与场景铺设则在业务现场进行。以物流场景为例,现场工人佩戴手套采集数据后,公司完成基础模型训练并部署至现场,仅需极少量微调即可实现业务落地。
商业化方面,灵初智能理性排除了任务繁杂的家庭场景及封闭单一的工业场景,选择流程清晰、泛化需求高的物流场景作为切入点。公司正通过自建采集站点及合作方式,积累百万小时级别的高质量、高多样性数据集,而非单纯追求数据总量。目前,该技术已与多家大客户完成POC验证,多台设备在客户现场常态化运行,预计今年年底实现小批量放量,并计划逐步拓展海外市场。
暂无评论,快来抢沙发吧!