2026年7月,人工智能独角兽月之暗面正式推出新一代大模型Kimi K3。该模型以2.8万亿的总参数量,成为全球首款开放权重的3T级架构。特斯拉CEO埃隆·马斯克在评测报道中留言“令人印象深刻”,这是其第二次对该团队技术实力给予公开背书。
在支撑Kimi K3底层逻辑的关键技术论文《注意力残差》中,一位来自深圳、年仅17岁的高中生陈广宇作为共同第一作者亮相。他与苏剑林、苏州大学博士生张宇合作,提出了Block Attention Residuals方案。该设计通过区块划分与信息压缩,在维持模型效能的同时显著降低了计算与通信开销。此外,陈广宇还参与了Kimi K3另一核心架构KDA计算内核的加速研发。
陈广宇的成长轨迹打破了传统“神童”叙事。他并非奥赛金牌得主,而是于2024年才开始接触机器学习。其转折点源于2025年5月在社交平台分享的技术分析帖,该帖获得MIT博士杨松琳回复,并引起美国AI初创公司Tilde Research CEO注意。随后,他独自前往加州帕洛阿尔托,在Tilde实习七周,完成了内存优化混合专家模型(MoMoE)项目,并掌握了自定义Triton内核编写技能。
这种“需求驱动”的学习模式在AI领域展现出独特优势。从用决策树模型预测室友鼾声以缓解失眠,到通过研读GitHub开源项目掌握Triton语法,陈广宇证明了在知识获取扁平化的今天,自主探索与快速进入陌生领域的能力,正逐渐取代传统刷题式教育,成为行业创新的重要驱动力。
暂无评论,快来抢沙发吧!