全球首个3万亿级参数开源模型落地,月之暗面Kimi“图其至远”
2026-07-28 12:21:35 世界浙商
世界浙商客户端讯(记者:胡淼、陈思宇)7月27日晚,随着完整模型权重正式向全球开发者开放,月之暗面Kimi K3兑现了一个月前的承诺——全球首个3万亿参数级开源大模型自此真正落地。继DeepSeek之后,Kimi再次让“中国开源时刻”成为全球AI产业的关键词。

为长程复杂任务而生
Kimi K3最醒目的标签是“2.8万亿参数”。作为全球参数量最大的开源模型,它原生支持视觉理解,具备100万token上下文窗口,它采用MoE(Mixture of Experts)混合专家模型架构,每次只激活896个专家中的16个,并基于自研的KDA混合线性注意力机制与注意力残差架构构建。
通俗而言,这套架构像“精明的主管”,懂得按需点将,使得模型在任务的关键节点启用全注意力以保证精度,而在非关键路径上切换为线性注意力以降低推理成本,从而让百万级上下文解码速度最高提升6.3倍,训练效率提升约25%,用更少算力实现了更强能力。
能力上,K3被定位为“为长程编程、端到端知识工作和深度推理而生”。
测试案例颇具说服力:它能在24小时内自主完成GPU内核优化,表现逼近Claude Fable 5;能从零构建一套类Triton编译器MiniTriton,在部分工作负载上超越Triton与torch.compile;甚至在48小时自主运行中,基于开源EDA工具完成了一颗4mm²、集成146万标准单元的芯片设计,用于运行自身架构的nano模型。
用AI系统研发工程师的话说,K3将对话式AI进一步推向“项目式AI”,它不再是只回答问题,而是能持续完成跨文件、跨工具的工程级任务。第三方平台Artificial Analysis的数据亦显示,K3在BrowseComp基准上单次任务成本仅为GPT-5.6 Sol的一半,较Claude Fable 5便宜近一个数量级,在长程任务场景中展现出综合成本优势。

告别低价标签
与参数规模同样引人瞩目的,是K3的定价。
输入20元/百万token、输出100元/百万token,这一价格约为DeepSeek V4 Pro的20倍、智谱GLM-5.2的5倍,在国产模型中堪称最贵一档。但若将视线转向海外,其价格仅为Claude Fable 5的30%、GPT-5.6 Sol的60%,竞争力陡升。
面对“太贵”的质疑,月之暗面联合企业业务负责人黄震昕的回应是:“开源模型、中国大模型不该被贴上低价标签,我们做出了SOTA级模型,也该匹配合理的商业定价。”
高盛在研报中将其定性为“中国模型走向定价权的全新节点”。这一判断背后是行业逻辑的嬗变:大模型竞争正从“低价抢滩”转向“能力定价”。
当模型能够完成过去需要资深工程师数天乃至数周的复杂任务时,评价成本的标准已不再是单纯的Token单价,而是完成一个任务的总成本。不过,庞大的参数也带来了算力压力。上线不到48小时,Kimi便因GPU容量触及极限而紧急限制新用户注册,并将会员体系拆分为通用产品线与编码产品线。
这种“优先保障付费用户”的策略,在短期内抑制了需求,却也侧面印证了K3作为生产力工具的吸引力。不过,有行业人士指出,随着未来模型蒸馏与更优架构的出现,Token消耗将大幅降低。
资本与生态的共振
K3的发布剧烈搅动了资本市场。7月17日,英伟达、谷歌、Meta、英特尔股价走低,美国媒体将K3视作关键催化剂。
港股方面,智谱、MiniMax次日分别下跌28.49%和15.62%,华创证券研报明确提及K3发布是重要原因。与此同时,月之暗面的估值水涨船高,媒体报道其计划以500亿美元投前估值于8月启动上市前最后一轮融资,最快6个月内登陆港股。
更大的冲击在于开源生态。Kimi K3将完整权重开放,意味着任何人都可以下载、部署并自由用于商业产品。这激起了两极化反应:OpenAI未来战略主管迪恩·鲍尔称开源是“减速主义”,会削弱商业AI公司的投资回报,进而阻碍行业发展;而杨植麟的博士导师、苹果首任AI总监Russ Salakhutdinov在接受《中国企业家》杂志采访时力挺爱徒,认为开源虽然是把优势让给竞争对手的“更难的路”,但它将催生大量蒸馏优化版本,当用户数据填充后,模型成本与效率将得到极大改善,最终深刻改变AI格局。
事实上,K3开源后,开源社区已可期待一轮新的创新浪潮——训练大模型、蒸馏小模型、让小模型追平甚至超越大模型效率的循环,正因这一3万亿参数的基座而被加速。
攀登至难的人
K3的背后,是一个中国AI领域最被寄予厚望的面孔——杨植麟。
这位本科清华、博士毕业于卡内基梅隆大学的科学家,被导师用“才华横溢、极其勤奋、谦逊”来形容。他在清华特奖答辩中被唐杰称为“这几年见过最优秀的学生”,在CMU不到四年完成博士学位,提出XLNet、Transformer-XL等已成为AI理论基础的工作。
Russ教授透露,杨植麟可以轻松留美任教,但他第一时间坚持回国创业,理由是“如果我连试都不试一下,我会后悔的”。在杨植麟他看来,做模型的过程本质上是在创造一种世界观,体现着对“好的AI应该是什么样、应该追求何种价值观”的理解。面对技术发展中的风险争议,他始终态度明确“所有的技术突破都伴随着风险,但我们不能因恐惧而停滞不前。”
杨植麟身上的独特之处在于技术与商业的双重底色。他既能深入底层做TPU优化,也能自如地与斯坦福、MIT的教授对话,更在清华组建乐队、担任鼓手。
月之暗面内部人士曾形容他有“从实验室里‘整锅端’人才”的号召力。这种复合能力,使Kimi在激烈的人才与资本竞争中始终保持领先身位,也让K3的每一步战略——无论是坚持开源还是定出高价——都带有鲜明的个人烙印。

或许并非巧合,在中国大模型的叙事中,月之暗面与DeepSeek正构成一种精神上的互文。
Kimi的命名指向探索未知的“月之暗面”,DeepSeek则是“深度求索”,两个名字都在描绘一种向无人之境挺进的姿态。
更意味深长的是它们各自的宣言:Kimi K3发布时说,“犯其至难而图其至远者,发之以勇,守之以专,达之以强”;DeepSeek V4发布时则言,“不诱于誉,不恐于诽,率道而行,端然正己”。
前者取法苏轼,昭告一种向最高难度挑战的勇毅与专注;后者源自《荀子·非十二子》,彰显不随外界毁誉而动摇的定力与正道。两者表述虽异,内核却高度一致——都是对长期主义的坚守,对技术本质的忠诚,对走自己道路的自信。
K3发布时被业内称为“又一次的DeepSeek时刻”。回溯过往,DeepSeek曾以开源模型震动硅谷,证明了无需天文数字资本也能攀登性能高峰;如今Kimi K3则以3万亿参数级的开放,再进一步,让中国开源大模型从“单点亮相”走向“群体突破”。
它们一个勇于犯其至难,一个端然正己率道而行,共同构成中国AI挑战全球秩序的双子星。在这个意义上,K3的开源不仅是一个模型的胜利,更是一种精神的延续——当中国公司开始掌握定价权,当开源的权重模型成为全球开发者的新基座,世界看到的不再只是追随者,而是规则的共同书写者。
3万亿参数已经落地,但这只是更大故事的开场。正如黄震昕所说,Kimi的参数规模不会止步于此。而在“至难”与“正己”之间,中国AI正走出一条属于自己的探月之路。
