月之暗面Kimi K3背后的17岁极客:非典型天才的崛起路径

图片只作辅助表达,并非真实画面,由 AI 生成
资讯来源:互联网公开资料整合

2026年7月,人工智能独角兽月之暗面正式推出新一代大模型Kimi K3。该模型以2.8万亿的总参数量,成为全球首款开放权重的3T级架构。特斯拉CEO埃隆·马斯克在评测报道中留言“令人印象深刻”,这是其第二次对该团队技术实力给予公开背书。

在支撑Kimi K3底层逻辑的关键技术论文《注意力残差》中,一位来自深圳、年仅17岁的高中生陈广宇作为共同第一作者亮相。他与苏剑林、苏州大学博士生张宇合作,提出了Block Attention Residuals方案。该设计通过区块划分与信息压缩,在维持模型效能的同时显著降低了计算与通信开销。此外,陈广宇还参与了Kimi K3另一核心架构KDA计算内核的加速研发。

陈广宇的成长轨迹打破了传统“神童”叙事。他并非奥赛金牌得主,而是于2024年才开始接触机器学习。其转折点源于2025年5月在社交平台分享的技术分析帖,该帖获得MIT博士杨松琳回复,并引起美国AI初创公司Tilde Research CEO注意。随后,他独自前往加州帕洛阿尔托,在Tilde实习七周,完成了内存优化混合专家模型(MoMoE)项目,并掌握了自定义Triton内核编写技能。

这种“需求驱动”的学习模式在AI领域展现出独特优势。从用决策树模型预测室友鼾声以缓解失眠,到通过研读GitHub开源项目掌握Triton语法,陈广宇证明了在知识获取扁平化的今天,自主探索与快速进入陌生领域的能力,正逐渐取代传统刷题式教育,成为行业创新的重要驱动力。

浏览 17295 · 资讯ID: 30146

返回首页

相关问题

Kimi K3模型在开源权重方面有何突破?
Kimi K3是全球首个开放权重的3T级大模型,总参数量达到2.8万亿。
陈广宇在Kimi K3的研发中具体负责了哪些核心架构?
他参与了AttnRes(注意力残差)的研究,提出了Block Attention Residuals设计,并加速了KDA(Kimi Delta Attention)的计算内核。
陈广宇进入硅谷实习的关键契机是什么?
他在社交平台分享了一篇关于DeltaNet的技术博客,获得了MIT博士杨松琳的回复,进而引起Tilde Research CEO的注意并获得实习机会。
标签: AI 人工智能 美国

评论 (0)

暂无评论,快来抢沙发吧!