2022年ChatGPT的发布曾让行业笃信‘参数至上’,千亿参数与万卡集群成为入场券。然而,高昂的训练成本、性能提升的边际递减,以及通用人工智能的遥遥无期,迫使学界与业界重新审视技术路线。
传统大模型本质是‘统计匹配器’,擅长文字游戏却缺乏对物理世界的理解。为突破局限,多支团队另辟蹊径:纽约大学杨立昆与斯坦福李飞飞倡导‘世界模型’,强调智能需包含空间感知与交互模拟;国内仝人智能则尝试为机器人植入可感知物理空间的‘大脑’,以较低成本实现自主认知。
在架构层面,Transformer的二次方复杂度正被挑战。美国RWKV架构将计算复杂度降至线性,中科院‘瞬悉1.0’仅需2%数据量即可达到同等性能,上海岩芯数智的Yan架构则成为国内首个备案的非Transformer通用模型。与此同时,端侧智能兴起,清华刘知远团队提出‘密度定律’表明能力密度每三个月翻番,中国信通院预计未来三年AI手机渗透率将突破50%。具身智能亦通过‘现实-仿真-现实’范式,让AI在虚拟环境中试错学习。这些探索揭示:智能并非数据训练的专利,多元融合的生态才是未来方向。
暂无评论,快来抢沙发吧!