谁在训练 Kimi K3 ? 深挖贡献者名单,这有一份最全档案
📌 核心要点
- 在技术报告的最后,他们首次公布了Kimi K3背后的实际贡献者名单,我们细数了一下,有401位成员,可以说,这是月之暗面人才团队的一次全面亮相
- 雷峰网伴随 K3 的发布,月之暗面最新估值飙升至 315 亿美元,约为 2100 亿元人民币,而撑起这 2100 亿估值的,是一个极度年轻的团队
- 而在过去一年,月之暗面招聘的新人中有超过 100 个是通过内部推荐进来的
起底 K3 背后核心极客天团,人均扛起 7 亿估值! 作者丨高允毅 樊天骄 编辑丨马晓宁 7 月 27 日,月之暗面拿出全部诚意,直接把满血版 2.8T 模型 Kimi K3 全部开源了。在技术报告的最后,他们首次公布了Kimi K3背后的实际贡献者名单,我们细数了一下,有401位成员,可以说,这是月之暗面人才团队的一次全面亮相。从当初那个估值仅几亿美金的初创团队,到如今名副其实的“国产大模型之光”,月之暗面已然成为全球牌桌上,少数能与 Claude Fable 5 和 GPT-5.6 Sol 这样顶尖模型“掰手腕”的极客团队。雷峰网伴随 K3 的发布,月之暗面最新估值飙升至 315 亿美元,约为 2100 亿元人民币,而撑起这 2100 亿估值的,是一个极度年轻的团队。据公开信息显示,月之暗面大概有 300 多人,平均年龄不到30岁,其中,80% 是 I 人。如果换算一下,基本人均扛起7亿人民币的估值。月之暗面的组织形式十分扁平。月之暗面一共有五个创始人,平均每人直接对接 40-50 人。内部以“无职级、无KPI、无部门墙”著称,员工随时可以挑战老板。有一个细节是,在2025年初反思会,有员工提激进建议,杨植麟听完后做得比建议更激进,直接放弃 K1 转做 K2。这种不拘一格同样体现在公司的“灵魂”里。作为摇滚爱好者的杨植麟,将会议室冠以 Rolling Stones、Nirvana、Radiohead 等传奇乐队之名,甚至连 Kimi 的会员套餐都以 Adagio(柔板)、Allegro(快板)等音乐术语来命名。月之暗面坚信,在算力和数据日益同质化的今天,“品味”才是建立差异化壁垒的核心驱动力。这种品味不仅体现在模型打磨上,更深刻地映射在他们对人才的挑剔与渴望上。月之暗面喜欢雇佣 CEO 们,非常青睐有“创业者光环”或“赌徒基因”的人。据公开资料显示,公司内部至少有 50 人创办或加入过创业公司。而在过去一年,月之暗面招聘的新人中有超过 100 个是通过内部推荐进来的。今天,我们按照名单,全面深挖,将 K3贡献者有关的一切公开可信信息汇总于此。这支顶尖极客军团的核心背景与硬核实力,尽数展现。01Kimi 技术体系顶层基石▎周昕宇:周昕宇是月之暗面的核心联合创始人之一,同时他也是算法团队负责人。周昕宇与杨植麟早就相识,很有趣的一个细节是,周昕宇曾是清华大学 Splay 乐队吉他手,而鼓手正是杨植麟。在加入月之暗面之前,周昕宇曾在旷视从事算法量产及移动端模型研究。他与当时旷视的基础科研负责人、现任阶跃星辰的首席科学家张祥雨紧密合作,作为核心作者亲手写出了轻量化网络大作 ShuffleNet。周昕宇的主攻方向是大模型算法量产化,擅长将最前沿的实验室算法,高效率、低成本地转化为大规模生产线系统。他还擅长混合架构优化,在 Reddit 社区的技术交流(AMA)中,率先拆解了 Kimi K3 KDA 混合架构结合 NoPE MLA 的对比优势,证实该架构在预训练和强化学习中更省算力、速度更快。▎吴育昕:吴育昕是月之暗面的联合创始人之一。同时,他还是人工智能领域的顶尖专家与明星架构师,在深度学习、计算机视觉(CV)以及大语言模型(LLM)的底层工程架构与基础设施上拥有极深造诣 。吴育昕与杨植麟拥有相同的教育背景,本科毕业于清华大学计算机系,随后赴美国卡内基梅隆大学(CMU)深造 。他曾在 Meta AI 研究实验室(FAIR)担任研究工程师,期间主导并贡献了多项计算机视觉里程碑级技术。在与杨植麟创立月之暗面之前,吴育昕就已经在深度学习和计算机视觉领域留下了两个行业标准级的重磅成果:一个是作为 Detectron2 的主要创建者和开发者之一,这个项目直接重塑了全球计算机视觉的研究生态,成为全球成千上万视觉大模型和目标检测项目的“通用底座” 。更具开创性的是,他在 2018 年与顶尖学者何恺明共同发表了关于 Group Normalization 的大作,获得 ECCV 2018 最佳论文荣誉提名(Best Paper Honorable Mention)。这篇经典直接打破了传统 Batch Normalization 在小样本训练下的致命瓶颈。这种用一两行底层创新就“重写全球 AI 训练规则”的能力,让吴育昕在开源世界拥有极高的技术号召力。在月之暗面,他是那个打地基的人。他深度参与大模型架构与训练效率的优化工作,更曾亲临全球 PyTorch 开发者大会,向全世界硬核拆解 Kimi 对全球开源基建的底层贡献 。吴育昕的专攻方向,完美补齐了 Kimi 冲击下一代多模态长文本极限的最后一块拼图。他擅长高性能深度学习系统优化,解决的是如何让大模型在万亿参数下跑得更稳、算得更快、内存吃得更少,这正是 Kimi 在长文本和高并发下保持丝滑体验的技术铁壁 。作为深度学习里程碑之作 MoCo v1 的核心作者之一 ,他让 Kimi 不仅拥有行业最强的大脑(自然语言理解),更正在长出能够深度理解现实物理世界的眼睛(多模态视觉)。雷峰网▎张宇韬:张宇韬是月之暗面的联合创始人之一,同时也是月之暗面的 CTO。他与杨植麟为清华同门师兄弟,智谱创始人唐杰是他的老师。2016 年,张宇韬与杨植麟共同创立“循环智能”,随后,他与杨植麟共同创立“月之暗面”。如果说杨植麟是月之暗面的“领航员”,那么张宇韬就是那个负责把“智能”这艘巨轮动力系统调校到极致的首席工程师。 Kimi 能够在长文本、复杂推理和 Agent 任务执行上实现跨越式进化,张宇韬功不可没。在加入月之暗面之前,他已经在知识图谱与异构数据融合领域留下了数个“行业级”的重磅成果。他最广为人知的技术标签之一,是作为技术负责人主导了科技大数据分析平台 AMiner 的研发。这个如今服务于全球千万级学者的平台,其背后核心的异构数据融合技术就包含张宇韬在清华攻读博士期间参与构建的底层能力。这种对 “海量知识如何被机器吸收、理解并检索” 的深度洞察,直接构成了 Kimi 超长文本处理能力的技术底座。在学术贡献上,他在 KDD、CIKM 等计算机顶尖会议发表过多篇高引论文。他不仅擅长通过知识图谱让 AI 具备“逻辑感”,更是在循环智能时期就主导开发了“千循零样本 AI 平台”,实现了行业大模型在企业服务场景的规模化落地。张宇韬的专攻方向,精准预判了 AI 从“能对话”向“能干活”转变的每一个节点。 他专注于推动长上下文窗口技术和动态扩展网络架构,解决的是如何让 AI 在海量信息中保持“清醒”。在 2026 年 7 月的最新技术峰会上,他一针见血地梳理了行业工程化的三段技术脉络:2023 年是研究‘怎么问’的 Prompt 时代,2024 年演进到‘给足信息’的 Context 时代,而到了 2026 年,大模型正式步入 Harness 工程新阶段 。 如今,他正带领团队攻克“怎么构建运行环境、让 AI 出了问题能自己闭环修改”的 Agent 终极战局。▎许欣然:图注:右一是许欣然许欣然是月之暗面(Moonshot AI)工程副总裁兼 AI 基础设施负责人。他具备全栈底层开发经验,此前在旷视曾负责 MegEngine(天元)深度学习框架与亿级向量检索系统的研发。目前,他主要负责月之暗面大模型训练、推理与基础设施的整体架构设计。在大模型推理端,针对 Kimi 的长文本业务场景,他与团队联合设计了以 KV Cache 为中心的分离式推理架构 Mooncake。该成果因彻底分离了预填充(Prefill)与解码(Decode)阶段、缓解了百万级超长上下文的显存和 I/O 压力,获得了存储顶级会议 FAST 2025 最佳论文奖。同时,作为 MoBA(混合块注意力)机制的核心作者之一,他通过块级别注意力切分,在训练和推理两端为 Kimi 实现了大幅的降本增效。在模型训练端,他参与了开源项目 Moonlight 及其底层优化器 Muon 的研发,利用矩阵正交化处理替代传统 AdamW,降低了万亿参数模型在分布式训练中的算力成本。凭借这一系列在大规模长文本流量下的分布式存储与推理实践,他曾受邀在 GOSIM China 全球开源盛会上发表演讲。他的专攻方向始终聚焦于全栈大模型架构,致力于用更少的 FLOPs 损耗和 KV Cache 占用,支撑高智能的长文本推理。▎何蔚然:作为月之暗面推理系统负责人,他是存储顶会 FAST 2025 最佳论文的核心作者,是 Kimi 长文本推理架构工程落地的核心技术骨干。从 Kimi k1.5、Kimi-VL、K2 到 Kimi Linear、Kimi-Audio,再到 MoBA、Muon、AttnRes 等核心架构论文,其署名贯穿六代技术成果,所有工作始终围绕同一个核心:用系统设计换效率,让大模型真正用得起。加入月之暗面之前,何蔚然已经在高效计算领域深耕多年。他毕业于清华大学计算机系,早年深耕芯片布线与底层性能优化;旷视时期他主力攻坚自研 AI 芯片与低位宽神经网络,与后来的月之暗面联合创始人周昕宇同期共事 —— 周昕宇正是经典 OCR 文字检测方案 EAST 的第一发明人。2023年加入月之暗面后,他把多年的系统工程经验,全部落地到了万亿参数大模型的推理服务上。他最具代表性的成果,是 KVCache 分离式推理架构 Mooncake。这套系统打破了传统推理服务的架构定式,把大模型最耗显存的记忆缓存拆解出来集中调度,通过全局缓存复用和精细化路由,在算力规模不变的前提下,让 Kimi 的请求承载量提升超 75%。他在 2024 年 QCon 大会上披露,依托这套架构和持续的工程优化,Kimi 推理集群的单位成本一年下降超 20 倍。2025年2月,Mooncake 相关论文拿下 FAST 大会埃里克·里德尔最佳论文奖——这是存储系统领域的最高荣誉之一。更能体现其工程价值的是,早在论文正式获奖前,这套架构已经在 Kimi 生产环境数千个节点上稳定运行,每天处理上千亿 token 的用户请求。尽管 K3 技术报告未披露具体个人分工,但多项核心突破都延续着他团队的技术脉络:针对 KDA+MLA 混合架构下传统前缀缓存失效的难题,团队向 vLLM 社区贡献了官方适配实现;面向百万 token 长请求,集群采用缓存感知的路由调度策略,最大化缓存复用效率。最终 K3 交出的成绩是推理成本仅为 Claude Fable 5 的 38%,而 KVCache 优化、前缀缓存、成本控制,恰恰都是 Mooncake 体系的核心命题。从芯片布线到万亿大模型推理,何蔚然的技术路径始终清晰:死磕系统效率,用工程设计换更低的计算成本。如果说顶尖算法研究员为 Kimi 拉高了能力上限,他和团队做的,就是把这份旗舰级的能力落到实处,让更多普通用户能用得起、用得稳。02中坚攻坚·落地级骨干▎杜羽伦:杜羽伦在月之暗面负责预训练(Pretraining)与规模化(Scaling)方向。他毕业于美国伊利伊诺大学香槟分校和卡内基梅隆大学人工智能专业。随后加入循环智能,历任研究员、AI Lab 负责人,是月之暗面的核心技术元老。作为模型基座预训练与规模化方向的核心负责人,他的技术贡献完整贯穿了Kimi历代核心旗舰基座,以及VL、Audio等多模态全系列的架构设计。在底层技术突破中,他是《Attention Residuals》、《MoBA(混合块注意力)》以及预训练优化器论文《Muon is Scalable for LLM Training》的共同作者。其工作核心在于:通过块级别注意力切分与训练流重构,缓解超深网络中的信号衰减问题,显著提升万亿大模型的分布式训练效率。在工程开源层面,他是 MoonshotAI 官方开源项目的活跃核心贡献者。从代码协作记录来看,杜羽伦与算法专家苏剑林、推理系统负责人何蔚然之间有着高频的协同开发与代码审查配合,三者共同构成了 Kimi 支撑百万级长文本和全模态高效流转的底层技术闭环。▎张宇:张宇是月之暗面的核心架构师,主攻大语言模型的高效、可扩展和硬件友好型架构设计。作为非 Transformer与线性注意力路线开拓者,他致力于攻克长文本“越长越慢、极度烧钱”的工程魔咒。在学术与工程实践上,张宇成果颇丰。他不仅是残差连接《Attention Residuals》论文共同第一作者,更是月之暗面高效模型架构的核心研发一作。由他主导开源的 Kimi Linear 模型,首次将线性注意力机制成功应用于超长上下文任务,实现了颠覆性的效率跃升。不仅如此,他在知乎等技术社区分享的 “Kimi Linear 研发心路”,至今仍被无数大模型数据工程师奉为必读指南。从实现 7B 模型的底层破局,到一战助力万亿参数大模型冲入全球第一阵营,张宇游刃有余地穿梭于学术界与工业界,在顶级学术会议和开源社区中留下了众多硬核代码。这一系列突破源于他在核心技术上的深耕:在高效模型架构设计上,他专注于模型深度扩展过程中的通信与内存瓶颈优化;在训练动态与效率提升方面,他通过重构底层残差流,从根本上解决了大模型中 PreNorm 导致的梯度稀释与隐状态爆炸问题。▎赖国堃:赖国堃是杨植麟的清华兼卡内基梅隆大学双重校友。他是 Kimi团队论文数量最多的研究者之一,有十余篇论文,他不仅是月之暗面“天才俱乐部”的代表人物之一,是Kimi K3 的核心贡献者,更是在学术界拥有“定义级”成果的大神。在加入月之暗面之前,赖国堃已经在 NLP(自然语言处理)领域留下了两个行业标准级的重磅成果。一个是打造了全球最大的机器阅读理解数据集之一 “RACE 数据集”,RACE 数据集直接用中国学生英语考试题训练 AI,成为了全球机器阅读理解的标尺。更惊人的是,他在本科时期写的一篇关于推荐算法的论文《Explicit factor models for explainable recommendation 》,在十年后的 2024 年还拿到了 SIGIR 时间检验奖,这是信息检索领域的最高荣誉之一,专门颁发给 10 年前发表、经得起时间考验、对行业产生持久影响的论文。这种在本科阶段就具备‘定义未来十年技术路线’能力的人,在月之暗面并不是孤例。赖国堃专攻方向非常契合 Kimi 的核心能力,比如其擅长“机器阅读理解 ”,解决的是如何让 AI 读懂长文档并回答问题的,这正是 Kimi 长文本能力的核心技术底座。预训练大模型是他在 CMU 期间的研究重点之一,此外还专攻神经架构搜索,研究如何让 AI 自动设计更好的网络结构。以及可解释性推荐系统,让 AI 不仅推荐内容,还能告诉用户为什么推荐这个。▎郭海清:郭海清(Haiqing Guo)是月之暗面 Kimi 团队的早期核心研发成员,属于团队元老级人物,全程参与 Kimi 多代核心项目的研发迭代。公开可核实的参与项目包括 Kimi k1.5 技术报告、Kimi K2 技术报告、注意力残差(AttnRes)核心架构论文、Kimi K3 技术报告。其中 AttnRes 是 Kimi K3的两大核心架构创新之一。从署名轨迹来看,他覆盖了 Kimi 从 k1.5 到 K3 三代旗舰版本的完整迭代周期,参与范围贯穿多代产品的核心研发环节,是 Kimi 技术团队的持续核心参与者。目前公开渠道暂未披露其具体岗位与细分研发分工。▎陈广宇:陈广宇恐怕是月之暗面最年轻的研究员,09 年出生, 17 岁,一个曾让埃隆·马斯克(Elon Musk)在 X 上公开惊叹 “Impressive” 的少年。在月之暗面推出震惊世界的 2.8 万亿参数旗舰 Kimi K3 时,他已经和技术大牛苏剑林等人并列,成为了 Kimi K3 核心架构奠基作《Attention Residuals》的共同第一作者。他参与的注意力残差(Attention Residuals)机制,直接对深度学习领域沿用了近十年的标准残差连接动了刀,用“可学习的深度注意力”让模型能够聪明地“回头看”,这一底层重构直接将模型的扩展效率拉高了 1.25 倍,让中国公司在万亿规模的顶级算力战局里,能够以更低的开销跑得更快。他加入月之暗面的故事十分神奇。一年前的他甚至连什么是 Transformer 都不知道,因在一场黑客松中想出过“人类第三只机械辅助手”的构想而被硅谷初创公司挖掘 。7 周后,他被 Kimi 团队彻底看中并破格接入了公司的核心研究组 。在入职的第一周,他就打破一切常规,直接手撕并斩获了 Kimi 内部 48 小时极限黑客马拉松的总冠军 。▎杜昂昂:在 Kimi 的技术报告里,杜昂昂的名字一直在最前面。他是月之暗面多模态体系的核心骨干之一,是 Kimi 技术报告中少有的五代全勤的研究者。他曾两度拿下团队署名后的第一顺位,推测他在 Kimi K3 中的核心贡献在视觉领域。在加入月之暗面之前,杜昂昂就已经在计算机视觉领域打下了两项分量十足的根基。一个是水下显微视觉方向的深耕。本硕七年就读于中国海洋大学水下视觉实验室,专攻难度极高的浮游生物显微图像分类——要在成像模糊、样本稀缺、物种差异极细微的显微镜画面里,让 AI 精准识别海洋中最小的生命。2020 年他以第一作者身份在 Global OCEANS 发表相关研究,用二阶特征建模破解了细粒度分类难题,是实验室十年该方向研究中,唯一由硕士生担任第一作者的成果。更具行业影响力的是他在旷视科技时期的产出。他参与的多人姿态估计研究被计算机视觉顶会 ECCV 2020 收录,论文累计引用超 300 次,成为人体姿态估计领域的重要参考。这篇工作的合作者名单里,既有孙剑、张祥雨等视觉领域领军人物,也有后来的月之暗面联合创始人周昕宇。来到 Kimi 后他深耕视觉编码器设计、多模态对齐与视觉智能体技术,尤其擅长高分辨率图像理解、长时序视频解析与多模态强化学习,这正是 Kimi 原生多模态能力的核心技术底座。除此之外,他的能力还向下延伸至大模型训练基建——从优化器稳定性到智能体数据合成,形成了从底层视觉算法到模型训练、再到上层智能体落地的全栈能力。2025 年他以第一作者发布 Kimi-VL 开源多模态模型,自研 MoonViT 视觉编码器原生支持超高分辨率输入,搭配128K 长上下文能力,让 Kimi 首次具备了通读长视频、长文档的多模态长文本理解能力,奠定了 Kimi 全系多模态能力的技术底座。K2 阶段,他深度参与 MuonClip 优化器研发,配合 QK-Clip 机制攻克大模型训练抖动的行业痛点,支撑 15.5 万亿Token 超大规模训练实现“零损失尖峰”,大幅压低了训练的算力成本与风险;到 K3 阶段,他主导的智能体数据合成流水线,让模型可以自主生成高质量训练数据,为 K3 在编程、智能体等硬核任务上跻身全球第一梯队提供了关键的数据支撑。对 Kimi 而言,他的贡献贯穿了多模态能力的整条演进路径。▎瞿博文:瞿博文(Bowen Qu / Brian Qu)隶属于模型后训练团队,本科毕业于华中科技大学电子信息与通信学院,硕士毕业于北京大学电子学院。他的研究主攻多模态大模型相关方向,具体覆盖多模态强化学习、视觉语言模型、AI 智能体以及 AIGC 内容质量评估。加入月之暗面后,瞿博文的核心工作围绕 Kimi 系列模型的多模态能力建设展开,深度参与 Kimi-K2.5 项目,并参与原生多模态强化学习方向的研发。Kimi-K2.5 是月之暗面推出的原生多模态智能体模型,总参数规模 1T,激活参数 32B。瞿博文负责的原生多模态强化学习体系,跳出了传统多模态模型先完成视觉监督微调、再开展强化学习的常规路径,提出从零视觉监督微调的纯文本推理模型出发,直接通过视觉强化学习获取视觉推理能力的训练方案,避免低质量视觉数据对模型原生语言推理能力造成干扰。瞿博文的研究起步于 AIGC 内容质量评估方向,相关成果先后发表于 ICME 2024、CVPRW 2024 等国际会议。其中发表于 ICME 2024 的相关论文,针对当时 AI 生成图像评价体系仅关注画面美观度、清晰度,忽略生成内容与用户指令匹配度的问题,提出将文本提示词纳入生成图像质量评价体系的方案,构建了同时覆盖视觉质量与指令遵循度的评价标准,提升了 AI 生成内容评价的全面性与人类感知对齐程度。瞿博文也出现在 Kimi 系列多模态版本的贡献者名单中。作为年轻研究者,瞿博文的研究路径从评价体系搭建延伸至模型能力建设,再落地到高阶智能体能力研发,成果紧密贴合产业实际需求,直接服务于生产级模型的迭代升级。▎鹿恩哲:在 Kimi K3 四百余人的贡献者名单里, 鹿恩哲 不是署名位置最靠前的,但出手异常精准。每一项成果都命中大模型落地的核心痛点,是 Kimi 高效算力体系的关键搭建者。鹿恩哲的研究方向可以用三个字精准概括:长、快、省,核心目标就是让大模型用更低的成本、更快的速度,处理更长的文本。对 Kimi 而言,他的所负责的是从训练到推理的全链路效率升级。2025 年 2 月,他以第一作者身份发布 MoBA 混合块注意力机制,把 MoE 的专家选择思路迁移到注意力层,让模型处理请求时只调取最相关的上下文块做计算。在 95% 稀疏度下效果与全注意力持平,实现百万 token 推理提速 6.5 倍、千万 token 提速 16 倍,直接打牢了 Kimi 超长上下文能力的底层架构。发布当天该论文与 DeepSeek 的 NSA 论文同期亮相,成为当年国内大模型圈最受关注的技术撞车事件;更能体现其工程价值的是,在被 NeurIPS 2025 收录为 Spotlight 论文之前,这套方案已经在 Kimi 生产环境稳定承载了近一年的长上下文用户请求。除此之外,从 MoBA 到 Kimi Linear 的 KDA 注意力,他参与的架构设计全程死磕硬件推理效率;在训练侧,他参与的 Muon 优化器分布式实现做到内存占用最优、通信开销高效,实打实压缩大模型训练的算力成本。算上 AttnRes 以及 K1.5、K2、Kimi-VL 等多代技术报告,他的论文完整覆盖了高效大模型的全链路技术。在团队内部,他与 MoBA 论文的通讯作者之一邱杰仲是固定搭档,一个冲锋落地,一个把控方向,配合默契。▎汪彧之:在 Kimi K3 四百余人的贡献者名单里, 汪彧之 不是署名位置最靠前的,但出镜率异常高。是每一项大模型技术文件落地的核心作者,是 Kimi 1.5,2,3,两份多模态,四篇架构与效率论文的关键作者。汪彧之的研究方向可以用视觉与高效计算精准概括,核心目标就是让大模型用更低的成本、更快的速度,处理更长的文本。对 Kimi 而言,他所负责的是从多模态到架构创新升级。2025 年 2 月,他以共同作者身份发布 MoBA 混合块注意力机制,把 MoE 的专家选择思路迁移到注意力层,让模型处理请求时只调取最相关的上下文块做计算。在 95% 稀疏度下效果与全注意力持平,实现百万 token 推理提速 6.5 倍、千万 token 提速 16 倍,直接打牢了 Kimi 超长上下文能力的底层架构。发布当天该论文与 DeepSeek 的 NSA 论文同期亮相,成为当年国内大模型圈最受关注的技术撞车事件;更能体现其工程价值的是,在被 NeurIPS 2025 收录为 Spotlight 论文之前,这套方案已经在 Kimi 生产环境稳定承载了近一年的长上下文用户请求。除此之外,从 MoBA 到 Kimi Linear 的 KDA 注意力,他参与的架构设计全程死磕硬件推理效率;在训练侧,他参与的 Muon 优化器分布式实现做到内存占用最优、通信开销高效,实打实压缩大模型训练的算力成本。算上 AttnRes 以及 k1.5、K2、Kimi-VL 等多代技术报告,他的论文完整覆盖了高效大模型的全链路技术。在团队内部,他参与 公司从多模态到架构创新多重技术线方向,配合默契。▎毛绍光:毛绍光是 Kimi Agent 技术线的核心骨干,全程参与 K2、K2-Thinking、K2.5、K3 四代旗舰研发,也是业内少有的完整经历 Agent 行业两次范式转换的研究者。加入月之暗面之前,他已是国内最早一批 Agent 落地的从业者。清华计算机硕士毕业,在校时排名位列前 0.2%、获国家奖学金,先后在香港中文大学任研究助理、微软亚洲研究院语音组实习。毕业后他在微软任职近六年,从研究院工程师成长为资深研发工程师。2023 年初参与研发 TaskMatrix.AI,为 ChatGPT 接入上百万 API 能力;随后共同提出 Solo Performance Prompting 方法,让单模型分饰多角色模拟多智能体协作,相关技术落地至 Microsoft 365 Word。那是 Agent 的“框架时代”——所有能力都靠外部工具拼接、靠 Prompt 引导,而他正是这套技术路线的亲历者与建设者。但亲手趟过这条路的毛绍光,最先看清了旧范式的瓶颈。2025 年 6 月,他在知乎写下一段行业自白:“这个方向越来越没意思了,有点加速衰亡的感觉”。2025年2月加入月之暗面后,他彻底转向“模型即 Agent ”的端到端路线。仅四个月就参与交付了 Kimi 首款 Agent 产品 Kimi Researcher:不靠任何流程预设,完全通过端到端强化学习训练而成,单任务平均完成 23 步推理,自主扫描 206 个网页,可产出带规范引用的万字调研报告,在 HLE 基准上达到 26.9%,刷新当时全球最高水平。他也是该产品官方技术自述的两位署名作者之一。此后从 K2 到 K3 的四代旗舰研发,他全程深度参与。HLE 指标从 8.6%一路攀升至 26.9%,这条几乎完全由强化学习驱动的性能曲线,正是他新技术路线的成绩单。从为大模型外接 API 扩展能力,到让模型内生学会调用工具、自主完成复杂任务,毛绍光近十年的职业轨迹,恰好勾勒出 Agent 行业从“拼装组合”走向“原生生长”的完整弧光。亲手参与过旧范式,又亲手走出新路线,他对行业的判断,有着最扎实的落地成果做支撑。▎秦若愚(Ruoyu Qin):秦若愚是清华大学计算机系 MADSys 实验室在读博士生,师从章明星副教授。他的研究主攻高效机器学习系统,具体覆盖大规模分布式大语言模型推理服务、强化学习 rollout 系统两大方向。秦若愚与月之暗面团队合作研发的 Mooncake,是一套以 KVCache 为中心的解耦推理架构。这套架构将 Prefill 与Decode 阶段拆分至独立集群运行,同时把 GPU 集群中闲置的 CPU、内存与 SSD 资源整合为分布式缓存池。该成果获得了存储领域顶 会 FAST 2025 的 Erik Riedel 最佳论文奖。Mooncake 是已落地应用的生产级服务平台,论文摘要开篇即明确标注 “Mooncake is the serving platform for Kimi” 。在真实业务负载下,Mooncake 可使 Kimi 的请求处理量提升 75%;长上下文场景中,有效请求处理能力提升59% 至 498%。目前该系统已部署在数千个节点上,每日处理 token 总量超 1000 亿。2024 年,月之暗面与清华 MADSys 实验室联合开源 Mooncake 项目(开源仓库为 kvcache-ai/Mooncake),截至目前项目 GitHub Star 数已超过 6000。相关数据与信息可参考 arXiv 论文(编号2407.00079)、清华计算机系官网公告及项目开源仓库。在 Mooncake 之后,秦若愚的研究持续围绕推理系统方向深入。他以第一作者身份完成的 Seer 论文入选 OSDI 2026,这项工作针对强化学习中的 rollout 性能瓶颈,通过 rollout 切分、上下文感知调度与分组投机解码技术,实现端到端 rollout 吞吐最高提升 2.04 倍,长尾延迟降低 72% 至 94%。另一篇一作论文 Prefill-as-a-Service,则进一步提出了 KVCache 跨数据中心共享的下一代推理架构设计思路。秦若愚也出现在 K3 项目的贡献者名单中。大模型的产品表现由两方面能力共同支撑:模型研发决定模型的能力上限,系统工程则决定高并发场景下服务的可用性与运行成本。当前大模型行业的竞争,正从训练能力的比拼逐步延伸至服务工程能力的较量。作为在读博士生,秦若愚能在该领域产出顶会最佳论文级别的成果,核心在于其研究直接面向生产场景,成果落地于真实业务系统。▎袁恩铭:月之暗面 Kimi 团队核心研发成员,研究轨迹横跨计算生物学、推荐系统与大模型三大领域,全程参与 Kimi 多代核心模型的技术迭代。早期他于清华大学交叉信息研究院曾坚阳课题组从事 AI 制药方向研究。2020 至 2021 年间,他参与的流感药物重定位框架研究先后发布于 bioRxiv 预印本与期刊《Signal Transduction and Targeted Therapy》,另有核衣壳蛋白相分离相关成果发表于《Protein & Cell》。2022 至 2023 年,袁恩铭任职于华为诺亚方舟实验室,聚焦推荐系统方向研究,成果覆盖多个国际顶级学术会议。其中他以第一作者完成的多行为序列推荐相关论文入选 SIGIR 2022,另有合作成果分别入选 CIKM 2022 与 WWW 2023。加入月之暗面后,袁恩铭深度参与 Kimi 多代核心模型与技术项目研发,公开可核实的署名项目包括 Kimi k1.5 强化学习技术报告、MoBA 技术研究、Kimi-VL 技术报告、Kimi K2 大模型技术报告、Kimi Linear 技术报告、Kimi K2.5 多模态模型技术报告与 Kimi K3 旗舰大模型技术报告。其参与范围覆盖强化学习训练、多模态能力、基础模型架构、长上下文系统等多个核心技术方向,完整贯穿 Kimi 从 k1.5 到 K3 的三代旗舰模型迭代周期,是团队内技术覆盖维度较广的核心研发人员。目前公开渠道暂未披露袁恩铭在月之暗面的具体岗位与细分研发分工。从公开署名轨迹来看,跨领域的研究背景支撑了他在大模型多技术方向的参与能力,是 Kimi 技术体系迭代过程中的重要持续参与者。▎许伟欣:许伟欣现任月之暗面(Moonshot AI)研究员,研究方向覆盖大模型基础架构、高效训练机制与 Attention 机制优化。许伟欣深度参与 Kimi 多代核心模型与底层技术研发,公开署名项目覆盖从 k1.5 到 K3 的完整产品迭代周期。月之暗面官方在 K3 发布后公开披露了三大核心自研技术——Muon 系优化器、Kimi Linear 线性注意力、Attention Residuals 注意力残差,Weixin Xu 是目前可核实的、唯一在三篇对应核心技术论文中均署名且顺位均在前 15 位的贡献者,是支撑 K3 架构性能升级的核心研发人员之一。具体成果方面,2025 年 2 月发布的 Muon 优化器论文中,他位列作者名单第 8 位,该优化器计算效率约为 AdamW 的两倍,后续配套开源的 Moonlight 训练实现同样有其参与;2025 年 10 月发布的 Kimi Linear 技术论文中,他位列第 15 位,该架构提出的 KDA 机制可将 KV Cache 体积最高降低 75%,百万 token 场景下解码吞吐最高提升 6 倍百万 token 场景下解码吞吐最高提升 6 倍;2026 年 3 月发布的 Attention Residuals 论文(K3 两大核心架构创新之一)中,他位列第 4 位,是三位共同一作之后的首位核心贡献者,相关技术已深度集成进 Kimi K3 基础模型架构。除此之外,他的署名还出现在 Kimi k1.5 强化学习技术报告、Kimi-VL 技术报告、Kimi K2 与 K2.5 技术报告,以及最新的 Kimi K3 旗舰模型技术报告贡献者名单中,参与范围覆盖基础模型、多模态、强化学习等多个核心研发方向。需明确的是,MoBA 论文作者列表中无其署名,二者不存在公开可查的研发关联。此外,他还参与了 OccDepth 三维语义场景补全、PVD-AL 主动学习蒸馏、ACCV 2024 隐式 SDF 重建等多项三维视觉方向研究,学术成果覆盖模型压缩、3D 重建、语义场景理解等多个细分领域。从公开署名轨迹来看,许伟欣的研究路径从端侧模型部署、三维视觉感知逐步延伸至大模型底层架构创新,长期深耕高效计算方向,技术覆盖跨度广,是月之暗面底层技术栈迭代的核心持续参与者核心持续参与者。▎杜晨壮:杜晨壮是月之暗面的核心研究员,是团队里负责强化学习与推理能力扩展的核心中坚力量。他本科毕业于北京航空航天大学信息管理与信息系统专业,随后进入大模型人才的黄埔军校——清华大学交叉信息研究院读博。在清华期间,他师从人工智能领域知名学者赵行,并加入了声名显赫的 MARS Lab(多模态与自主推理实验室),开始聚焦多模态机器学习、强化学习以及大语言模型强化机制。在博士求学期间,他作为核心作者研发了轰动一时的《ChatDB》架构,开创性地提出“用数据库作为符号性记忆模块增强大模型”,在当时的AI学术界和工业界一举刷屏。为了更早地积累工业级大系统的实战经验,他还在读博期间加入了北京海华人工智能研究院担任实习生,深度参与了从零开始搭建底层系统的硬核研究项目。这让他在多模态与强化学习领域积累了不少经验,更具备了系统加算法的底层视野。他毕业后加入月之暗面,频繁出现在核心模型的技术报告中。他直接参与了探索强化学习扩展律的重磅论文《Kimi k1.5: Scaling Reinforcement Learning with LLMs》,同时在 Kimi K2 和 K2.5 等旗舰系列模型的技术报告中也都扮演了核心贡献者的角色。他还作为核心共同作者深度参与了 Kimi 多模态视觉大模型《Kimi-VL Technical Report》的研发,专注于提升大模型对复杂图像、图表以及真实世界视觉信息的感知与多模态深度推理能力。杜晨壮的主攻方向是大规模大语言模型(LLM)训练工程,专注于万亿级大模型(MoE 架构)在超级集群中的资源调度、稳定训练与极限系统优化;以及强化学习与多模态融合,研究模型如何在复杂长推理任务下通过自监督、强化学习实现智能上限的跨越,并实现视觉信息与语言模型的高效底层融合。▎Yanru Chen:Yanru Chen 是月之暗面的核心研究员,专注于大模型底层架构、长文本技术、算力优化与多模态工程的研发与落地。作为 《Attention Residuals》 论文的共同作者,他参与重构了大模型深度方向的信息流动方式,成功攻克了超深网络训练效率低下和信息流阻断的行业痛点。在长文本核心技术上,他作为 MoBA(混合块注意力) 的共同作者,主导并参与了 Kimi 最看家的底层机制研发,通过块级别的注意力切分,直接解决了百万级超长上下文在预训练和推理端算力消耗过大的问题,成为 Kimi 极限降本增效的核心底座。同时,他还是 《Muon is Scalable for LLM Training》 论文的共同作者,深度参与了重磅开源项目 Moonlight 及其底层 Muon 优化器 的研发,通过矩阵正交化处理挑战了传统的 AdamW,极大地压缩了万亿大模型在分布式训练中的算力开销。在旗舰模型迭代中,他深度嵌入了 Kimi 历代核心旗舰(k1.5、K2、K2.5、K3)的研发全生命周期,解决了模型在大标度强化学习和万亿参数扩展下的稳定性与资源调度难题。此外,在 Kimi 多模态线(Linear、VL、Audio) 的技术攻坚中,他积极探索非传统 Transformer 结构的线性注意力创新,并主导推动了 Kimi 视觉与音频多模态技术报告的工程落地,高效解决了多模态信息流在底层融合时的效率瓶颈。▎刘少伟:刘少伟是清华大学顶级计算机系统实验室 MADSys 实验室的核心成员,同时也是月之暗面核心基础设施(Infra)团队的领军专家。当你感叹 Kimi 坐拥万亿参数、API 价格却极低,背后正是他与团队死磕的“极致量化艺术”。他常年深耕万亿级大模型的极致低成本推理、原生量化与大规模分布式计算拓扑设计。在全球最硬核的 AI 开源社区 Reddit LocalLLaMA 上,他曾以 Kimi 官方专家的身份,发表了轰动海外极客圈的技术拆解长文《Kimi infra team: Quantization is not a compromise, it's the next paradigm》 。这篇长文深度揭秘了 Kimi K2 与 K2.5 底层极其硬核的 Native INT4 原生量化格式 。他不仅是 MoBA(混合块注意力机制)的核心共同作者 ,更深度参与了重磅开源项目 Moonlight 及其底层 Muon 优化器的分布式架构研发,通过矩阵正交化处理极大地压缩了万亿大模型在分布式训练中的算力开销 。他还是月之暗面重磅开源项目KTransformers 的核心发起人和代码维护者之一,亲手打通了异构集群下万亿 MoE 模型混合推理的算力屏障 。▎陈冠多:陈冠多是月之暗面的 Infra 团队核心研究员。他具备极强的“系统+算法”跨界研发能力,他的研究领域高度聚焦于大模型基础设施(Infra)、高效注意力机制架构(Efficient Attention Architecture)、大模型微调加速以及大规模存储与检索优化。他本科与硕士均毕业于复旦大学计算机系,在分布式系统与底层架构领域打下了坚实的专业基础。随后,他前往南洋理工大学与香港科技大学进行深造,期间分别师从高性能计算与大模型基础设施领域的知名学者袁斌航和罗思强,积累了前沿的学术视野与研发经验。在正式加入月之暗面之前,他曾在顶尖互联网大厂的底层核心部门进行深度沉淀。他曾先后在字节跳动数据库系统研发团队以及美团基础设施团队担任研究实习生,深度参与了工业级高并发、大规模分布式系统的研发与架构优化。期间,他作为核心作者直接扔出了两项重磅成果。在底层存储上,他研发并发表了《Oasis》,提出了一种最优不相交分割学习范围滤波器,直接解决了底层数据库在大规模范围查询时的索引瓶颈;在应用层落地中,他发表了《Gar》,通过一种“生成和排序”的方法,大幅提升了大模型精准理解人类复杂意图并转化为 SQL 数据库查询语句(Text-to-SQL)的准确率。陈冠多于 2025 年 3 月正式加入月之暗面。作为 Infra 团队的中坚力量,他不仅是月之暗面旗舰大模型 Kimi K2 和 Kimi K2.5 的核心共同作者,还在大模型微调加速、高效注意力架构、甚至是网络架构重构等方向,密集输出了多项技术突破。为了解决大模型微调太烧显存的问题,陈冠多主导发表了《Ce-lora》论文,提出了一种计算高效型 LoRA 微调方法。这项技术通过降低大模型参数微调时的显存占用与计算开销,直接拉高了 Infra 层的训练吞吐量,堪称大模型微调的“显存瘦身术”。面对长文本计算复杂度呈平方级爆炸的问题,他参与研发并发表了轰动开源社区的 《Kimi Linear》 架构。这是一种富有表现力且高效的线性注意力架构,在保持模型强大表征能力的同时,极大降低了长文本计算的复杂度,成功将 KV Cache(键值缓存)占用最高砍掉 75%,并在百万文本长度下跑出了 6倍的解码吞吐量,是 Kimi 持续深耕长文本技术壁垒的硬核底座。他还是《Attention Residuals》 的共同作者之一。从最底层的存储过滤器、计算高效的微调算法,到颠覆性的下一代 Transformer 网络架构,陈冠多的职业生涯轨迹完美契合了当下大模型从“单纯卷参数”向“追求极致计算效率与工程落地”的行业范式。03结束语K3 的研发团队素来低调神秘,在梳理资料的过程中,我们也很难一一厘清全部成员的具体分工与完整履历。但透过这份沉甸甸的名单,答案已然浮出水面:为什么是月之暗面?为什么他们能撑起人均7亿的超级估值?这群平均年龄不到 30 岁的年轻人,是真正懂算力经济学的系统架构师。从斩获顶会最佳论文的存储调度,到重构注意力机制的底层创新,他们将“长、快、省”的工程效率做到了极致。正是这种从上层算法直到底层硬件的全栈打通,赋予了月之暗面打破“算力同质化”魔咒的核心壁垒。还一个有趣的细节是,在全员名单的结尾,Kimi K3 也成为整个研发团队的重要成员。创造者与被创造者开始在同一张名单上并肩而立,属于中国大模型的“黄金时代”,已然轰鸣而至。雷峰网参考链接:https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf上车,带你看遍全球 AI 顶会精华可独家畅览:专家演讲PPT大会报告全文热门论文解读学术新星访谈扫描上方二维码或点击「阅读原文」关注专区。