- Kimi K3 有 2.8万亿总参数。它采用混合专家架构:总共 896个专家,每处理一个 token 只激活 16个。按摩根士丹利整理,K3 在 Artificial Analysis 智能指数得 57分、全球第3,在 Arena 编码榜排 全球第1。
- 它不是靠低价抢眼球。K3 的 API 为每百万输入/输出 token 3美元/15美元;摩根士丹利的人民币口径是未缓存输入/缓存读取/输出 20元/2元/100元,在中国头部模型中最贵。
- 但放到美国前沿模型旁边,它又很便宜。伯恩斯坦估算,K3 比 Claude Opus 4.8 低 40%,比 Claude Fable 低 70%。这形成了最关键的反差:对内涨价,对外打折。
- 伯恩斯坦据发布时间判断,中美前沿能力差距可能只剩 3—4个月。高盛则把竞争力拆成三件事:定价权、成本优势、财务实力。模型够聪明只是入场券,能不能赚钱取决于后两项。
- K3 的“蝴蝶效应”会落在模型公司之外:低端 API 继续降价,智能体应用争夺入口,阿里云和大平台获得更多议价权,海外访问与监管风险也可能上升。
- 三家机构都没有把 K3 说成一夜奇迹。大摩强调它是中国模型行业长期积累的结果;伯恩斯坦则提醒,蒸馏能帮助后训练,却替代不了更难的预训练规模。
一、2.8万亿参数很大,但真正值钱的是“只叫16个专家干活”
先把 K3 的体量说清楚。
它有 2.8万亿总参数,是摩根士丹利统计中当时最大的中国开放权重模型。所谓开放权重,是开发者能拿到模型参数、自己部署或继续训练;它不等于训练数据和全部技术细节都公开。大摩援引公司计划称,完整权重预计在 7月27日前发布。
K3 采用 MoE,也就是“混合专家”架构。模型里放着 896 个擅长不同任务的专家模块,但每处理一个 token,只挑 16 个参与计算。打个比方,一家公司名册上有 896 位专家,接到任务后不必让所有人同时开会,只叫最相关的 16 位进会议室。2.8万亿描述知识容量,16个激活专家更接近一次推理真正动用的计算量。
大摩还特别点了两个算法:Kimi Delta Attention 和 Attention Residual。报告只给出一个谨慎结论——这些原创设计有助于提升计算效率。
那“更大”有没有换来“更聪明”?至少在报告选用的榜单上,答案偏向肯定。
- Artificial Analysis 智能指数:K3 57分,全球第3,仅落后两个美国模型。
- Arena 编码榜:K3 全球第1。
- 大摩列出的六组编码评测里,K3 在 Program Bench 得 77.8、SWE Marathon 得 42.0,两项排名第一;Terminal Bench 2.1 得 88.3,只比第一名的 88.8 低 0.5 分。
- 另外三项为 DeepSWE 67.5、FrontierSWE 81.2、Kimi Code Bench 2.0 内部集 72.9。不同测试的设置、数据污染风险和是否允许联网并不完全相同,不能把六个分数简单加总。

大摩因此用了两个限定很重要的判断:2.8万亿参数可能说明 scaling law(规模定律,即投入更多参数、数据和算力,模型能力通常继续提高)仍然有效;但 K3 不是突然从天上掉下来的奇迹,而是 GLM-5.2 等中国模型持续进步之后的一次累积结果。
展开查看六组编码基准复绘

二、中国最贵、美国前沿的三折:K3 为什么敢这么定价?
K3 最值得看的,不是“又一个便宜的中国模型”,而是它第一次认真测试中国模型的定价权。
伯恩斯坦列出的美元 API 价格是:每百万输入 token 3美元,输出 15美元,缓存命中时通常再打九折。摩根士丹利按人民币列得更细:未缓存输入 20元、缓存读取 2元、输出 100元。
大摩表中的六个模型上下文窗口均为 1000K。完整对比如下:
| 模型 | 总参数(B) | 未缓存输入 | 缓存读取 | 输出 | AA 智能指数 |
|---|---|---|---|---|---|
| Kimi K3 | 2800 | 20.00元 | 2.00元 | 100.00元 | 57 |
| Qwen3.7 Max | 未披露 | 12.00元 | 2.40元 | 36.00元 | 46 |
| GLM-5.2 | 754 | 8.00元 | 2.00元 | 28.00元 | 51 |
| MiniMax M3 | 428 | 3.15元 | 0.63元 | 12.60元 | 44 |
| DeepSeek V4 Pro | 1600 | 3.00元 | 0.02元 | 6.00元 | 44 |
| MiMo V2.5 Pro | 1000 | 3.00元 | 0.03元 | 6.00元 | 42 |
同一张表里,K3 的输出价是 GLM-5.2 的 3.6倍,是 DeepSeek V4 Pro 的 16.7倍。高盛用自己的混合用量口径,算出 K3 每百万 token 约 2.3美元,也高于 Qwen3.7 Max 的 1.4 美元、GLM-5.2 的 0.9 美元、MiniMax M3 的 0.22 美元和 DeepSeek V4 Pro 的 0.18 美元。
这不是说 K3 一定“更划算”。价格是厂商想收多少,成本还要看完成一项任务到底会消耗多少 token。高盛估算,跑完 Artificial Analysis 整套智能测试,K3 约花 0.9美元,比 Qwen3.7 Max 的 1.0 美元略低,却高于 GLM-5.2 的 0.5 美元、MiniMax 的 0.1 美元和 DeepSeek 的 0.04 美元。
真正有意思的是另一侧。伯恩斯坦估算,K3 比 Claude Opus 4.8 便宜 40%,比 Claude Fable 便宜 70%。也就是说,它在中国模型里站到了高价档,在美国前沿模型面前却仍像折扣品。
K3 把高价格与高智能指数绑定,试着证明中国模型也能收能力溢价。
能力越接近,价格差越难被忽略,也越容易压低前沿模型的终局利润率。

三、不是谁打败谁,而是前沿能力开始“撞车”
伯恩斯坦把 K3 与今年更早的 DeepSeek V3、GLM-5.2 放在一起看:这些模型不断证明,中国实验室可以跟上美国前沿。
它以 Claude Mythos 4 月初发布,以及 GLM-5.2 比 Opus 4.6 晚约四个月为参照,判断中美最先进模型可能只差 3—4个月。这不是一把可以永久使用的尺子,只是特定版本发布时间给出的观察。但对商业模式来说,方向比精确月份更重要:当前沿模型在推理和编码上越来越像,厂商就更难长期维持高价。
市场先交易了“谁会输”。高盛记录,K3 发布当天,智谱下跌 28%,MiniMax 下跌 16%。它认为,股价反应反映了投资者在押注谁能成为中国模型竞争的长期赢家。
伯恩斯坦则直接重排了自己的中国榜单:Kimi 暂时超过智谱居首,阿里千问第三,DeepSeek 随后。它的理由不是单看一个总榜,而是 Kimi 同时拥有最大的预训练规模,并在 DeepSWE、Terminal Bench 等它认为有参考价值的测试里拿到高分。
但这张座次表随时会动。智谱被催着推出自己的万亿参数模型;伯恩斯坦还判断,智谱创始人唐杰所说“最早 2027 年一季度出现中国 Mythos 级模型”,指的可能是智谱下一轮更大预训练。阿里云栖大会也是下一处催化剂。高盛预计,2026 年下半年还会出现更多 2万亿—5万亿参数的中国模型,重点仍是编码,同时补上多模态和视觉理解。至于 DeepSeek 排在后面,伯恩斯坦把原因部分归结为它为国产芯片兼容投入约 6个月——这是该机构的分析,不是 DeepSeek 的公开归因。

四、模型够强只是第一关,真正的考试是能不能赚钱
高盛给了一个比排行榜更适合投资者的框架。它认为判断一家模型公司,要同时看三件事:

K3 把第一项往前推了一大步,却不会自动解决后两项。高盛预计,2026 年下半年,低端智能体模型的 API 价格仍会停留在每百万 token 0.1—0.2美元附近并继续承压。原因很现实:中国模型公司融资后现金充足,有能力用补贴换市场。
这会把行业撕成两层。最强模型尝试凭能力涨价;低端模型继续把价格压到接近基础设施成本。最后赢的不一定是榜单第一,而是能在“贵得有理由”和“便宜得可持续”之间找到位置的公司。
来源:Goldman Sachs Global Investment Research。
为什么高盛认为视频模型可能比文本模型更赚钱?
高盛认为它的定价和毛利率比基础文本模型健康。报告援引数据称,字节跳动 Seedance 毛利率约 70%,最新 ARR 约 20亿美元;快手 Kling、MiniMax 海螺也是主要玩家。高盛预计,视频生成与大语言模型结合、以及算力供不应求,会继续支撑 2026 年下半年的增长。
这不是 K3 的收入数据,而是一组对照:基础文本越来越像价格透明的“通用原料”,视频等供给紧张、体验差异大的能力,暂时更容易保住利润。
五、K3 的蝴蝶效应,会先吹到应用入口和大平台
模型越来越强、越来越多,应用入口反而更值钱。
高盛预计,中国模型公司会把智能体应用当成关键入口,尤其是编程。智谱 ZCode、腾讯 Workbuddy、阿里 Qoder 都在做聚合平台:前面接用户的真实任务,后面可以切换多种模型。谁掌握入口,谁就能获得最稀缺的现实编程和智能体数据,再把它们喂回模型迭代。
下一步不只是“帮我写一段代码”,而是多人协作和行业专家智能体。模型实验室会想把“模型—应用—数据—再训练”闭成一圈。
这也解释了伯恩斯坦为什么认为,K3 对阿里和腾讯的影响主要是间接利好。
阿里在 2024 年 2 月的一轮融资中取得 Kimi 36% 股权,腾讯也是已知投资者。股权价值是一层,更重要的是模型层越碎片化,大型分发平台和 AI 用户的议价权越高。平台可以让多个模型竞争,不必被一家供应商锁死。伯恩斯坦据此判断,Kimi 成功边际上利好阿里云收入;它还注意到,Workbuddy 据报已有每月 800万—900万次访问。这是访问量,不等于月活用户,但说明入口的增长速度值得跟踪。
高盛在股票覆盖中也把受益方向更多放在基础设施:云与数据中心关注阿里、GDS、VNET 和金山云;模型公司中更看好 MiniMax 的上行风险收益,但关键仍是融资后能否建立定价权,以及 7—8 月 M3 更新和下半年 M3 Pro 的兑现。这些是高盛报告时点的选股观点,不是本文的投资建议。
展开查看伯恩斯坦的投资结论与估值表复绘

另一股风则可能来自监管。
伯恩斯坦判断,如果中国开放模型以美国前沿模型三折左右的价格提供接近能力,Anthropic 可能更积极推动限制中国模型进入美国市场。高盛也把“海外更难访问最先进中国模型”列入后续风险。两家机构写的是可能性,不是已经落地的禁令。真正要观察的是:开放权重让模型更容易全球扩散,地缘政治会不会反过来把这种扩散堵住。
六、最后绕不开蒸馏:聪明到底是“学来的”,还是“练出来的”?
Anthropic 近期把智谱加入其指控涉嫌不当蒸馏的中国实验室名单。所谓蒸馏,是让一个模型用另一个更强模型的输出做训练材料,把部分能力“教”给自己。
伯恩斯坦的观点相当直接:行业里“大家都在互相蒸馏”。但它同时划出了一条重要边界——蒸馏主要帮助启动后训练,比如监督微调;它无法决定预训练的规模,更不能替代从零组织万亿参数训练所需的数据、算力和工程能力。Kimi 认为后者才是更大的挑战,伯恩斯坦表示认同。
报告还举了一个带讽刺意味的反例:Thinking Machines 的首个模型 Inkling,在文档中披露使用了 Kimi K2.5 生成的数据。伯恩斯坦借此质疑行业对“谁蒸馏谁”的叙事是否一致。这个案例不等于给任何一方下法律结论,但它提醒我们:模型学习彼此输出已经是产业现实,真正难复制的仍是大规模预训练和稳定交付。
这也把文章拉回起点。K3 的 2.8万亿参数不是全部,算法也不是点石成金。更准确的说法是:规模把能力上限推高,算法把计算用得更聪明,价格则检验市场是否承认这种能力。
真正值得看的,不是榜单第一能坐多久
三份研报对 K3 的共同判断,可以浓缩成一句话:中国大模型正在从“成本效率故事”,走向“智能与定价权故事”。
这比一次排行榜变动重要得多。便宜只能证明你愿意少收钱;敢在国内卖最贵,才是在测试用户是否承认你的能力溢价。可一旦这种能力又以美国前沿模型的三折价格出海,它就会同时压迫两边:国内同业被迫追参数、追榜单,美国实验室被迫守价格、守市场。
接下来真正该盯的有四件事:K3 的高价能否换来持续 token 收入;智谱、千问、DeepSeek 的下一代模型如何回应;智能体入口能否沉淀独家数据;以及海外市场会不会用监管抵消价格竞争。
K3 可能很快会被下一次发布挤下某张榜单。但如果它证明中国模型可以同时做到够强、够大、敢涨价、还能对全球前沿打折,那它留下的就不是一座奖杯,而是一套新的竞争规则。
本文依据: 伯恩斯坦 Robin Zhu 等人于 2026 年 7 月 17 日发布的《China Internet: The Kimi moment - quick thoughts on the butterfly effects》; 高盛 Ronald Keung 等人于 2026 年 7 月 18 日发布的《Navigating China AI models: New frontier from Kimi K3; from cost efficiency, intelligence to pricing power of Chinese models》; 摩根士丹利 Gary Yu、Lydia Lin 于 2026 年 7 月 17 日发布的《China AI Foundation Model: Moonshot K3: What's Our View》