出品 | 搜狐科技
作者 | 梁昌均
马斯克那句Impressive,成了华尔街惊呼DeepSeek2.0时刻的开端。90后清华才俊一战成名,凭借新出的Kimi K3大模型,将美股市场搅得波澜四起。月之暗面公布的这款参数高达2.8万亿的模型,不仅刷新了国产模型的纪录,在全球评测中位列第三,前端编程能力更是独占鳌头,成功从智谱手中夺回了开源模型的榜首位置。
不少市场分析机构指出,这或许是中国大模型迎头赶上的明确信号。原本认为开源与闭源模型之间存在半年之差,如今这个差距已缩水至两三个月。更有海外网友好奇,为何杨植麟博士不选择留在美国,而是投身国内AI事业。
自新模型发布以来,月之暗面融资疯狂,推进上市进程,在经历了一段迷茫与沉寂之后,终于找回了属于自己的节奏。探索通用人工智能(AGI)如同攀登无尽雪山,但对于这家公司来说,他们已经摸索出了一条独特的道路。
### 国产大模型再攀高峰
WAIC(世界人工智能大会)开幕前夕(7月16日),月之暗面在深夜悄然发布了新一代模型Kimi K3。
今年第二次参加WAIC的月之暗面,展台位于角落位置,延续了以往清新的蓝色调。搜狐科技探访时,现场排队领取礼品的人群络绎不绝,但似乎并无太多人关注K3,这款模型早已成为了全球AI圈的焦点。
发布之后,马斯克赞叹不已,称“Impressive”,同时透露自家正在研发一个2万亿参数级别的模型,完成初步训练后有望超越Kimi。月之暗面对此积极回应,用一句“欢迎加入2万亿+俱乐部”展现了大模型的自信。
摩根士丹利评论道,K3标志着中国大模型在规模、性能及价格上全面向美国领先者靠拢。为此,美国大模型公司们感到有些焦虑,纷纷调整用户使用限制,并提高了模型的使用额度。
Claude平台宣布,自7月20日起,将永久为Max和Team Premium订阅用户开放最新Fable 5模型。OpenAI也调整了Codex和ChatGPT Work付费用户的限额。不少开发者在社交媒体上表示,感谢开源的K3带来的便利。
Kimi K3的问世,象征了中国开源模型的持续崛起。自DeepSeek、千问、智谱、月之暗面、MiniMax等模型以来,国产大模型轮流占据全球开源模型榜首的位置,而这次的K3则将这一纪录推向了新高。
K3拥有2.8万亿的参数数量,支持高达100万token的上下文窗口,是世界上首个开源的3万亿级模型。该模型专注于长程编程、知识任务和推理等领域。
官方评测显示,K3的综合表现在所有模型中仅次于Claude Fable 5和GPT-5.6 Sol,稳定地超越了其他所有模型。
权威机构Artificial Analysis的数据表明,K3的全球排名第三,是中国大模型有史以来最靠前的成绩,取代智谱GLM5.2成为全球最强的开源模型。
在大模型竞技场Arena发布的Fronted Code盲评榜单中,K3更是力压Claude Fable 5,登顶全球第一,这是中国模型首次在前端编程领域取得榜首位置。
加州大学伯克利分校的计算机科学教授伊翁·斯托伊卡(Ion Stoica)指出:“我们过去常说,中国的开源模型比最先进的模型落后六到九个月,但目前这个差距应该只有两到三个月了。”
不少开发者的实际体验证明,K3的表现确实令人满意。一位测试用户向搜狐科技分享道,K3在前端网页和编程方面的能力极强,整体表现与当前排名相符,尽管仍需人工核实细节,但模型运算速度明显加快。
月之暗面也坦承K3存在一些局限性,例如对历史信息敏感可能导致内容生成不稳定,以及模型过于主动可能做出非预期决策等问题。
官方表示:“Kimi K3作为一个非常有竞争力的模型,在用户体验上与Claude Fable 5和GPT-5.6 Sol相比仍存在一定差距。”
7月27日,K3的完整权重将正式公开展示,全球开发者将掀起开源模型的Token热潮。
### DeepSeek2.0时刻已然来临?
Kimi K3的发布不仅是AI行业的重大事件,也波及到了资本市场,引发了投资者对于算力投资逻辑的重新思考。
Arena榜单的运营负责人认为,K3的推出证明了高性能大模型不一定需要动用天价算力,或将迫使投资者重新评估整个AI行业的发展策略。
摩根大通直言,K3的发布给市场带来了负面影响,“DeepSeek 2.0的担忧拖累了亚洲和美国科技股的表现”。
2025年初,低成本且高效能的DeepSeek-R1开源平台亮相,引发了全球AI界的震动,英伟达股价应声暴跌17%,从而催生了“DeepSeek时刻”的说法。
K3发布后,全球AI市场出现剧烈波动。费城半导体指数承压,英伟达市值一度被苹果超越。智谱和MiniMaxAI股价双双大跌,两个交易日内市值蒸发超过3200亿港元。
最新交易日,费城半导体指数上涨超过5%,英伟达收复了全球市值第一的位置。A股市场在利好消息刺激下大幅反弹,智谱和MiniMaxAI也出现上涨,但随后又纷纷回落。
尽管K3引发的市场震荡小于DeepSeek-R1,但从大模型的技术发展路径来看,月之暗面和DeepSeek展现出了“中国特色”——在算力受限的情况下,通过系统创新持续提升模型的智能水平。
高盛的分析师明确指出,这不是扩展定律失效,而是表明单纯依靠扩展预训练算力不再是取得领先地位的唯一途径,算力扩张的时代可能已经接近尾声。
“更值得深入探讨的是,一家无法与美国最大规模预训练算力相匹敌的中国实验室,是如何通过架构创新、合成数据、强化学习和后训练技术,迅速缩小了与顶级美国模型之间的差距。”高盛的分析师说道。
答案并不模糊。早在2024年底的一次媒体沟通会上,杨植麟就强调,AI的关键在于Scaling,但这并不等于简单地把模型做得更大,核心是找到有效的方法来实现Scale。
从Kimi K3本身来看,其拥有2.8万亿的参数量,意味着能够容纳更多的知识,具备更强的理解、思考和回答能力。这一切的关键,在于模型架构层面的系统性创新。
有技术专家分析道,K3对深度学习中沿用了十年的三大组件——注意力机制、残差连接和优化器,均进行了替换或重构。“这是一次系统性的架构博弈,也彰显了从底层重新审视大模型架构的技术自信。”
具体而言,K3采用了月之暗面独创的KDA混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals),从而有效解决了长上下文计算效率的问题,以及训练过程中的信息稀释与稳定性问题。
同时,K3进一步提高了MoE(Mixture of Experts)的稀疏度,使得模型能够按需调用,加上训练方法和数据配方的优化,从而缩短了训练周期,并减少了算力和显存的使用,让K3的整体扩展效率比K2提升了约2.5倍。
这些架构创新受到了行业的高度评价。知名AI专家安德烈·卡帕蒂(Andrej Karpathy)评论说:“看来我们还没完全理解‘Attention is All You Need’这句话的字面含义。”甚至有观点认为,这可能预示着深度学习的2.0时代已经到来。
月之暗面并未透露K3的训练成本,但API的价格明显上浮,每百万Token输入的费用为2元(命中缓存)和20元(未命中缓存),输出的费用为100元。
相比上一代模型K2.7,K3的API价格有所提高,其中输出价格更是暴涨2.7倍,成为国内定价最高的模型,一改开源模型通常价格低廉的印象。然而,与Claude Fable 5和GPT-5.6 Sol的输出价格分别为50美元和30美元相比,K3依然具有明显的成本优势。
高盛分析认为,中国开源模型的智能水平已经达到了可以全球扩散的临界点,开始掌握定价权。过去,这些模型主要依靠性价比优势进入市场,现在则凭借前沿技术引领市场。
这也引发了部分头部闭源模型的不满。OpenAI的未来战略负责人Dean W. Ball发布声明称,开源模型权重的开放会削弱前沿模型的商业收益,降低企业继续投入数百亿美元研发下一代模型的热情。
他因此认为,开源本质上是一种“减速主义”力量,并预测美国可能提高企业使用中国开源模型的法律和监管门槛。这家曾经拥抱开源的大模型公司,彻底转向了闭源道路。
显然,随着开源模型的不断迭代,头部闭源模型正面临更大的挑战。这不仅是技术的竞争,更是对商业和估值逻辑的直接冲击。从这个角度来看,K3延续了DeepSeek 2.0的时代浪潮。
在Kimi K3发布仅48小时后,月之暗面就宣布暂停C端用户的订阅服务,将现有算力完全用于已订阅用户的体验,并正在积极扩容算力资源。
原因很简单,K3上线后的受欢迎程度远超预期,用户请求量激增,导致算力资源紧张。月之暗面在官方表态中承认,“面临始料未及的算力挑战,现有集群的承载极限已被突破”,因此选择优先保障老用户的体验。
目前,月之暗面主要使用阿里云的算力服务,而吴泳铭此前曾表示,服务器上的GPU等加速设备几乎满负荷运行。要想迅速找到足够的可用算力,还需要时间。
业内人士认为,尽管K3引发了关于大模型预训练算力扩展路径的讨论,但这并不代表最终算力需求会减少,因为算力市场的结构正在发生根本性变化。
花旗银行分析指出,如果中国开源模型继续快速发展,美国前沿AI实验室更有可能增加而非减少算力投入,以保持竞争优势。
K3发布后,阿里发布2.4万亿参数的Qwen3.8预览版,MiniMax被曝出将推出参数高达2.7万亿的M3 Pro模型,而GPT-6的参数量可能达到6万亿。
可见,头部企业在参数数量上的竞争仍在继续,但国产模型正在探索新的扩展路径——通过系统级架构创新,实现成本和效率的双重突破。
一位国产芯片企业的人员告诉搜狐科技,其所在企业面临订单爆满的局面,推理需求远大于训练需求,而H20芯片已经难以满足当前的推理需求。但受限于产能等因素,未来一两年内国内算力供应紧张的局面难以缓解。
月之暗面提到,由于推理过程需要更大的高带宽通信域,建议在64卡或更多加速器组成的超节点配置上部署K3。而今年的WAIC展会上,国产芯片厂商纷纷展示了超节点集群的技术成果。
可见,这款2.8万亿参数的模型要完全运行并支持百万级长文本和多智能体并行任务,需要更高的算力成本,远超上一代Kimi K2的16卡配置要求。
背后的大模型的杰文斯悖论是,技术进步虽然能够提高效率并降低成本,但最终需求的增长反而会导致资源消耗的增加。大模型用得越多,成本越高,算力成本和Token产出的平衡将是一场持续的拉锯战。
从最近智谱和MiniMax合计高达400多亿的再融资来看,算力依然是投入的主要方向。而这些算力资源,可能更多用于满足推理需求和Token的爆发式增长。
最新消息称,智谱已经建成1GW级国产AI算力数据中心,并完成了国产AI异构算力软件企业中科加禾的收购,从算力规模和效率两方面加速布局。这一动向带动了智谱股价在昨日暴涨37%。
今年以来,月之暗面也在积极推进融资。媒体报道称,其即将完成新一轮估值315亿美元的融资,计划在投前达到500亿美元估值后开启新一轮融资,最快可能在未来半年内在香港股市上市。
形势促使变局,此前曾表示不急于上市的杨植麟,如今看来也不得不加快上市步伐。









