✓ 已核对研究解读来源 · Bernstein, Goldman Sachs & Morgan Stanley Research

2.8万亿参数、国内最贵、全球前三:Kimi K3 把中国大模型拖进“定价权之战”

伯恩斯坦、高盛和摩根士丹利看到的不是一次普通升级,而是中国模型从“便宜能用”跨到“够强、敢涨价、开始争入口”的拐点。

研究解读 · Bernstein, Goldman Sachs & Morgan Stanley Research

三十秒读懂
  • Kimi K3 有 2.8万亿总参数。它采用混合专家架构:总共 896个专家,每处理一个 token 只激活 16个。按摩根士丹利整理,K3 在 Artificial Analysis 智能指数得 57分、全球第3,在 Arena 编码榜排 全球第1
  • 它不是靠低价抢眼球。K3 的 API 为每百万输入/输出 token 3美元/15美元;摩根士丹利的人民币口径是未缓存输入/缓存读取/输出 20元/2元/100元,在中国头部模型中最贵。
  • 但放到美国前沿模型旁边,它又很便宜。伯恩斯坦估算,K3 比 Claude Opus 4.8 低 40%,比 Claude Fable 低 70%。这形成了最关键的反差:对内涨价,对外打折。
  • 伯恩斯坦据发布时间判断,中美前沿能力差距可能只剩 3—4个月。高盛则把竞争力拆成三件事:定价权、成本优势、财务实力。模型够聪明只是入场券,能不能赚钱取决于后两项。
  • K3 的“蝴蝶效应”会落在模型公司之外:低端 API 继续降价,智能体应用争夺入口,阿里云和大平台获得更多议价权,海外访问与监管风险也可能上升。
  • 三家机构都没有把 K3 说成一夜奇迹。大摩强调它是中国模型行业长期积累的结果;伯恩斯坦则提醒,蒸馏能帮助后训练,却替代不了更难的预训练规模。

一、2.8万亿参数很大,但真正值钱的是“只叫16个专家干活”

先把 K3 的体量说清楚。

它有 2.8万亿总参数,是摩根士丹利统计中当时最大的中国开放权重模型。所谓开放权重,是开发者能拿到模型参数、自己部署或继续训练;它不等于训练数据和全部技术细节都公开。大摩援引公司计划称,完整权重预计在 7月27日前发布。

K3 采用 MoE,也就是“混合专家”架构。模型里放着 896 个擅长不同任务的专家模块,但每处理一个 token,只挑 16 个参与计算。打个比方,一家公司名册上有 896 位专家,接到任务后不必让所有人同时开会,只叫最相关的 16 位进会议室。2.8万亿描述知识容量,16个激活专家更接近一次推理真正动用的计算量。

大摩还特别点了两个算法:Kimi Delta Attention 和 Attention Residual。报告只给出一个谨慎结论——这些原创设计有助于提升计算效率。

那“更大”有没有换来“更聪明”?至少在报告选用的榜单上,答案偏向肯定。

  • Artificial Analysis 智能指数:K3 57分,全球第3,仅落后两个美国模型。
  • Arena 编码榜:K3 全球第1
  • 大摩列出的六组编码评测里,K3 在 Program Bench 得 77.8、SWE Marathon 得 42.0,两项排名第一;Terminal Bench 2.1 得 88.3,只比第一名的 88.8 低 0.5 分。
  • 另外三项为 DeepSWE 67.5、FrontierSWE 81.2、Kimi Code Bench 2.0 内部集 72.9。不同测试的设置、数据污染风险和是否允许联网并不完全相同,不能把六个分数简单加总。
摩根士丹利复绘的中国前沿模型参数、价格与智能指数对比
来源:公司、Artificial Analysis、Morgan Stanley Research。按摩根士丹利 Exhibit 1 复绘;不同模型的许可方式并不完全相同。

大摩因此用了两个限定很重要的判断:2.8万亿参数可能说明 scaling law(规模定律,即投入更多参数、数据和算力,模型能力通常继续提高)仍然有效;但 K3 不是突然从天上掉下来的奇迹,而是 GLM-5.2 等中国模型持续进步之后的一次累积结果。

展开查看六组编码基准复绘
摩根士丹利 K3 六组编码基准复绘
来源:Moonshot、Morgan Stanley Research。按摩根士丹利 Exhibit 2 复绘。原图将美国模型匿名化,并提示部分结果可能受数据污染或联网设置影响。

二、中国最贵、美国前沿的三折:K3 为什么敢这么定价?

K3 最值得看的,不是“又一个便宜的中国模型”,而是它第一次认真测试中国模型的定价权。

伯恩斯坦列出的美元 API 价格是:每百万输入 token 3美元,输出 15美元,缓存命中时通常再打九折。摩根士丹利按人民币列得更细:未缓存输入 20元、缓存读取 2元、输出 100元

大摩表中的六个模型上下文窗口均为 1000K。完整对比如下:

模型总参数(B)未缓存输入缓存读取输出AA 智能指数
Kimi K3280020.00元2.00元100.00元57
Qwen3.7 Max未披露12.00元2.40元36.00元46
GLM-5.27548.00元2.00元28.00元51
MiniMax M34283.15元0.63元12.60元44
DeepSeek V4 Pro16003.00元0.02元6.00元44
MiMo V2.5 Pro10003.00元0.03元6.00元42

同一张表里,K3 的输出价是 GLM-5.2 的 3.6倍,是 DeepSeek V4 Pro 的 16.7倍。高盛用自己的混合用量口径,算出 K3 每百万 token 约 2.3美元,也高于 Qwen3.7 Max 的 1.4 美元、GLM-5.2 的 0.9 美元、MiniMax M3 的 0.22 美元和 DeepSeek V4 Pro 的 0.18 美元。

这不是说 K3 一定“更划算”。价格是厂商想收多少,成本还要看完成一项任务到底会消耗多少 token。高盛估算,跑完 Artificial Analysis 整套智能测试,K3 约花 0.9美元,比 Qwen3.7 Max 的 1.0 美元略低,却高于 GLM-5.2 的 0.5 美元、MiniMax 的 0.1 美元和 DeepSeek 的 0.04 美元。

真正有意思的是另一侧。伯恩斯坦估算,K3 比 Claude Opus 4.8 便宜 40%,比 Claude Fable 便宜 70%。也就是说,它在中国模型里站到了高价档,在美国前沿模型面前却仍像折扣品。

一套价格,两场战争
面对中国同业不再只卖“便宜”

K3 把高价格与高智能指数绑定,试着证明中国模型也能收能力溢价。

面对美国前沿仍以 40%—70% 折扣竞争

能力越接近,价格差越难被忽略,也越容易压低前沿模型的终局利润率。

高盛复绘的 K3 排名、混合 API 价格与测试成本
来源:LMArena、Artificial Analysis、Goldman Sachs Global Investment Research。价格和测试成本采用高盛口径,不能直接等同于模型质量或厂商毛利。

三、不是谁打败谁,而是前沿能力开始“撞车”

伯恩斯坦把 K3 与今年更早的 DeepSeek V3、GLM-5.2 放在一起看:这些模型不断证明,中国实验室可以跟上美国前沿。

它以 Claude Mythos 4 月初发布,以及 GLM-5.2 比 Opus 4.6 晚约四个月为参照,判断中美最先进模型可能只差 3—4个月。这不是一把可以永久使用的尺子,只是特定版本发布时间给出的观察。但对商业模式来说,方向比精确月份更重要:当前沿模型在推理和编码上越来越像,厂商就更难长期维持高价。

市场先交易了“谁会输”。高盛记录,K3 发布当天,智谱下跌 28%,MiniMax 下跌 16%。它认为,股价反应反映了投资者在押注谁能成为中国模型竞争的长期赢家。

伯恩斯坦则直接重排了自己的中国榜单:Kimi 暂时超过智谱居首,阿里千问第三,DeepSeek 随后。它的理由不是单看一个总榜,而是 Kimi 同时拥有最大的预训练规模,并在 DeepSWE、Terminal Bench 等它认为有参考价值的测试里拿到高分。

但这张座次表随时会动。智谱被催着推出自己的万亿参数模型;伯恩斯坦还判断,智谱创始人唐杰所说“最早 2027 年一季度出现中国 Mythos 级模型”,指的可能是智谱下一轮更大预训练。阿里云栖大会也是下一处催化剂。高盛预计,2026 年下半年还会出现更多 2万亿—5万亿参数的中国模型,重点仍是编码,同时补上多模态和视觉理解。至于 DeepSeek 排在后面,伯恩斯坦把原因部分归结为它为国产芯片兼容投入约 6个月——这是该机构的分析,不是 DeepSeek 的公开归因。

一枚巨大的智能核心进入拥挤的价格赛道,三条冲击波分别推向模型公司、应用平台与算力基础设施
概念图:K3 的冲击不止于榜单,它会把竞争传到价格、应用入口与算力层。由 image-2 根据三份研报主线生成。

四、模型够强只是第一关,真正的考试是能不能赚钱

高盛给了一个比排行榜更适合投资者的框架。它认为判断一家模型公司,要同时看三件事:

高盛分析中国模型公司的三维框架:定价权、成本优势与财务实力
高盛 Exhibits 5—6 复绘:保留可核对的三维框架与指标,不把原报告的主观雷达面积改写成统一性能排名。

K3 把第一项往前推了一大步,却不会自动解决后两项。高盛预计,2026 年下半年,低端智能体模型的 API 价格仍会停留在每百万 token 0.1—0.2美元附近并继续承压。原因很现实:中国模型公司融资后现金充足,有能力用补贴换市场。

这会把行业撕成两层。最强模型尝试凭能力涨价;低端模型继续把价格压到接近基础设施成本。最后赢的不一定是榜单第一,而是能在“贵得有理由”和“便宜得可持续”之间找到位置的公司。

来源:Goldman Sachs Global Investment Research。

为什么高盛认为视频模型可能比文本模型更赚钱?

高盛认为它的定价和毛利率比基础文本模型健康。报告援引数据称,字节跳动 Seedance 毛利率约 70%,最新 ARR 约 20亿美元;快手 Kling、MiniMax 海螺也是主要玩家。高盛预计,视频生成与大语言模型结合、以及算力供不应求,会继续支撑 2026 年下半年的增长。

这不是 K3 的收入数据,而是一组对照:基础文本越来越像价格透明的“通用原料”,视频等供给紧张、体验差异大的能力,暂时更容易保住利润。

五、K3 的蝴蝶效应,会先吹到应用入口和大平台

模型越来越强、越来越多,应用入口反而更值钱。

高盛预计,中国模型公司会把智能体应用当成关键入口,尤其是编程。智谱 ZCode、腾讯 Workbuddy、阿里 Qoder 都在做聚合平台:前面接用户的真实任务,后面可以切换多种模型。谁掌握入口,谁就能获得最稀缺的现实编程和智能体数据,再把它们喂回模型迭代。

下一步不只是“帮我写一段代码”,而是多人协作和行业专家智能体。模型实验室会想把“模型—应用—数据—再训练”闭成一圈。

这也解释了伯恩斯坦为什么认为,K3 对阿里和腾讯的影响主要是间接利好。

阿里在 2024 年 2 月的一轮融资中取得 Kimi 36% 股权,腾讯也是已知投资者。股权价值是一层,更重要的是模型层越碎片化,大型分发平台和 AI 用户的议价权越高。平台可以让多个模型竞争,不必被一家供应商锁死。伯恩斯坦据此判断,Kimi 成功边际上利好阿里云收入;它还注意到,Workbuddy 据报已有每月 800万—900万次访问。这是访问量,不等于月活用户,但说明入口的增长速度值得跟踪。

高盛在股票覆盖中也把受益方向更多放在基础设施:云与数据中心关注阿里、GDS、VNET 和金山云;模型公司中更看好 MiniMax 的上行风险收益,但关键仍是融资后能否建立定价权,以及 7—8 月 M3 更新和下半年 M3 Pro 的兑现。这些是高盛报告时点的选股观点,不是本文的投资建议。

展开查看伯恩斯坦的投资结论与估值表复绘
伯恩斯坦对 K3 的投资结论及腾讯、阿里估值表高清复绘
来源:Bloomberg、Bernstein estimates and analysis;价格截至 2026 年 7 月 16 日。评级、目标价和预测仅代表报告时点观点,不构成投资建议。

另一股风则可能来自监管。

伯恩斯坦判断,如果中国开放模型以美国前沿模型三折左右的价格提供接近能力,Anthropic 可能更积极推动限制中国模型进入美国市场。高盛也把“海外更难访问最先进中国模型”列入后续风险。两家机构写的是可能性,不是已经落地的禁令。真正要观察的是:开放权重让模型更容易全球扩散,地缘政治会不会反过来把这种扩散堵住。

六、最后绕不开蒸馏:聪明到底是“学来的”,还是“练出来的”?

Anthropic 近期把智谱加入其指控涉嫌不当蒸馏的中国实验室名单。所谓蒸馏,是让一个模型用另一个更强模型的输出做训练材料,把部分能力“教”给自己。

伯恩斯坦的观点相当直接:行业里“大家都在互相蒸馏”。但它同时划出了一条重要边界——蒸馏主要帮助启动后训练,比如监督微调;它无法决定预训练的规模,更不能替代从零组织万亿参数训练所需的数据、算力和工程能力。Kimi 认为后者才是更大的挑战,伯恩斯坦表示认同。

报告还举了一个带讽刺意味的反例:Thinking Machines 的首个模型 Inkling,在文档中披露使用了 Kimi K2.5 生成的数据。伯恩斯坦借此质疑行业对“谁蒸馏谁”的叙事是否一致。这个案例不等于给任何一方下法律结论,但它提醒我们:模型学习彼此输出已经是产业现实,真正难复制的仍是大规模预训练和稳定交付。

这也把文章拉回起点。K3 的 2.8万亿参数不是全部,算法也不是点石成金。更准确的说法是:规模把能力上限推高,算法把计算用得更聪明,价格则检验市场是否承认这种能力。

真正值得看的,不是榜单第一能坐多久

三份研报对 K3 的共同判断,可以浓缩成一句话:中国大模型正在从“成本效率故事”,走向“智能与定价权故事”。

这比一次排行榜变动重要得多。便宜只能证明你愿意少收钱;敢在国内卖最贵,才是在测试用户是否承认你的能力溢价。可一旦这种能力又以美国前沿模型的三折价格出海,它就会同时压迫两边:国内同业被迫追参数、追榜单,美国实验室被迫守价格、守市场。

接下来真正该盯的有四件事:K3 的高价能否换来持续 token 收入;智谱、千问、DeepSeek 的下一代模型如何回应;智能体入口能否沉淀独家数据;以及海外市场会不会用监管抵消价格竞争。

K3 可能很快会被下一次发布挤下某张榜单。但如果它证明中国模型可以同时做到够强、够大、敢涨价、还能对全球前沿打折,那它留下的就不是一座奖杯,而是一套新的竞争规则。

来源与阅读提示

本文依据: 伯恩斯坦 Robin Zhu 等人于 2026 年 7 月 17 日发布的《China Internet: The Kimi moment - quick thoughts on the butterfly effects》; 高盛 Ronald Keung 等人于 2026 年 7 月 18 日发布的《Navigating China AI models: New frontier from Kimi K3; from cost efficiency, intelligence to pricing power of Chinese models》; 摩根士丹利 Gary Yu、Lydia Lin 于 2026 年 7 月 17 日发布的《China AI Foundation Model: Moonshot K3: What's Our View》