Amplifying/agent-intelligence

研究报告

Edwin Ong & Alex Vikati · 2026 年 7 月

Read in English

Kimi K3 和 GLM-5.2 到底推荐什么
(中国大模型 vs Claude Sonnet 5)

我们让 Claude Sonnet 5、Kimi K3 和 GLM-5.2 回答同样的 60 个开发工具选型问题,每题中英文各问一遍,跑在 5 个真实项目仓库上,共 1,860 条回答。用英文问,三个模型的答案高度一致;换成中文,答案就变了。

12 个类目 · 5 个仓库 · 每模型跑 2 轮 · 0 条运行失败

Claude Code / Sonnet 5 · Kimi Code CLI / kimi-k3 · ZCode CLI / GLM-5.2

TLDR

  • 用英文问,中国的前沿模型和 Claude 几乎是一个口径:西方工具拿走约 96% 的首选(本套 12 个类目内),而 Kimi K3 被问「该接哪家大模型 API」时,最常见的答案就是 Claude 自己。
  • 同样的问题换成中文,国产阵容就出现了:点名国内厂商的回答,Kimi K3 从约 1% 涨到 32.5%,GLM-5.2 从 3% 涨到 49.3%。
  • 全部请求都来自美国 IP。变的只有提问语言,而三个模型(包括 Claude)都开始把建议拆成 「国内用户」和「海外用户」两套。
  • 唯一每次都推荐自家的是 Claude Code:60 条大模型 API 回答全部首选 Anthropic,中英文都一样。而英文提问下,Kimi Code 和 ZCode 一次都没选过自家。
1,860
回答总数
每模型 620 条;42 条未给出推荐
3
Agent
每个模型跑在自家官方 CLI 里
60 × 2
问题
每题分别用英文和中文各问一遍
12
类目
每个类目都有靠谱的国产选项
2
语言
唯一被操纵的变量

每个类目的入选标准只有一条:存在有分量的国产替代。阿里云 OSS 对 S3,高德对 Google Maps,支付宝对 Stripe,DeepSeek 对 OpenAI。提示词从不点名任何厂商;除一条托管题写了「拓展亚洲市场」外,其余均不含地理信息,也不提中国。 中文版就是同样的问题,用自然的开发者中文再问一遍。所有请求都从美国 IP 发出,每组对照中我们有意改变的唯一变量是提问语言。

测试仓库

nextjs-saas

Next.js SaaS

python-api

FastAPI service

react-spa

React + Vite SPA

node-cli

Node/TS CLI

kotlin-android-app

Kotlin Android

用英文问,中国模型给出的答案与 Claude 几乎相同

英文提问时,首选推荐中,国内厂商所占的比例。三个模型都把 95-96% 的首选给了西方技术栈。

Claude Sonnet 5 434 个首选)

西方技术栈 95.4%
0.7%

Kimi K3 440 个首选)

西方技术栈 96.1%
0.9%

GLM-5.2 449 个首选)

西方技术栈 95.6%
1.8%

已出海的中国厂商(TiDB、声网 Agora、DeepSeek)单独归类,各模型均另有约 2.5%,Claude 也一样。

同一道题选中同一个工具的比例(英文)

Claude ↔ Kimi K362.7% (n=306)
Claude ↔ GLM-5.259.0% (n=290)
Kimi K3 ↔ GLM-5.262.1% (n=293)

Kimi 与 Claude 的一致率,和它与 GLM 之间基本相同。三个模型给出的英文答案高度接近。

英文共识相当彻底:云托管三家都首推 Vercel(50-56%),支付三家都是 Stripe(100%),产品分析都是 PostHog(57-87%),短信都是 Twilio(67-73%),登录认证都是 Clerk(45-50%)。就本基准的英文部分而言,一个北京训练的模型,和一个旧金山训练的模型给出的推荐高度近似。

最明显的例外,是一家中国厂商在英文里同样赢下了题目。数据库类目里有两道题分别问「兼容 MySQL 的分布式数据库」和「HTAP 数据库」,三个模型在这两道题上全都选了 TiDB:48 条回答,48 次,中英文都一样。TiDB 出自 PingCAP,也是 GLM-5.2 在英文数据库题上的第一首选。一款中国厂商的产品只要真正做到了全球采用,提问语言就不再起作用。

把问题翻译成中文,技术栈就变了

首选推荐中包含至少一家国内厂商的回答占比,按提问语言对比。两种语言下的题目与仓库完全相同。中文回答每条点名的工具本来就更多(2.1 个对 1.5 个),因此也更容易带上一家国内厂商;下文按「占全部首选的比例」计算的数字,是同一结果在控制了回答长度之后的版本。

0%20%40%60%Sonnet 51%23.9%Kimi K31%32.5%GLM-5.22.7%49.3%
英文提问中文提问

英文提问

i want to add an ai chat feature to this app. which llm api should i use

推荐:Anthropic 的 Claude API(通过 @anthropic-ai/sdk)。Claude 模型正擅长部署 CLI 助手要做的事:解释命令、读日志、诊断失败的部署。(原文为英文)

Kimi K3 · node-cli · 第 1 轮

中文提问

我想给这个应用加一个 AI 聊天功能,应该接哪家大模型 API

推荐:DeepSeek 或 Kimi(Moonshot)… 国内可直接访问、可直接充值,不需要解决网络和境外支付问题… Claude / OpenAI:模型质量确实好,官方 TS SDK 也成熟,但国内直连和付费都麻烦。

Kimi K3 · node-cli · 第 1 轮

这不是整体换血。中文回答里,西方工具仍占大头(63-76% 的首选),国产厂商是被加在旁边的,通常出现在一段明确的「国内用户 / 海外用户」分支里。上面 Kimi 的中文回答先点了 DeepSeek 和自家模型,然后补充说 Claude 和 OpenAI「模型质量确实好」,但在国内直连和付费都麻烦。这是对用户处境的判断,而模型能依据的只有提问的语言。

同一道题的中英两版之间,首选本身换掉的频率:GLM-5.2 在 289 组对照中换了 60.9%,Kimi K3 换了 47.2%,Claude 换了 30.4%。Claude 换得最少,但对于全场最稳定的模型(两轮之间首选一致率 79%,两个中国模型是 65-70%)来说,仅仅换一种语言就有三成的题换答案,仍然是很大的移动。

Claude Code 每一条大模型 API 回答都推荐 Anthropic;英文提问下,Kimi Code 和 ZCode 从未把自家列为首选

大模型 API 类目问的是该基于哪家模型开发:加个 AI 聊天功能、做文档摘要、做代码助手。每个 Agent 都在回答关于自己所在市场的问题。先提醒一点:每个模型都跑在自家 Agent 里,其系统提示词我们看不到,所以这些是关于成品 Agent 的结论,而非裸模型;Claude Code 的回答一开头就带着 Claude 预设(「如果这个功能是用 Claude 来做」)。要把模型本身的偏好剥离出来,需要在同一个中立外壳里重跑。

把自家厂商列为首选的比例

100%100%Sonnet 50%56.7%Kimi K30%48.3%GLM-5.2
英文提问 中文提问

每格 n=26 至 30 条回答;精确值 100/100、0/56.7、0/48.3。

Claude Code 在全部 60 条大模型 API 回答里都把 Anthropic 列为首选,两种语言、两轮、五个仓库,没有一次例外。Kimi 和 GLM 在英文回答里把自家列为首选的次数是零。用英文问 Kimi 该接哪家大模型 API,它最常见的答案是 Claude(57%);GLM 则在 OpenAI(54%)和 Gemini(46%)之间摇摆。

用中文问,两个中国模型确实会推自家了,比例都在一半上下。但它们共同的答案是 DeepSeek:Kimi 的中文大模型回答里 80% 点了它,GLM 是 72%。两家还各自在约一半的中文回答里点名了直接竞争对手(Kimi 提智谱 53%,GLM 提月之暗面 52%)。两个互为对手的实验室,最常给出的答案都是第三方 DeepSeek(它同样是两家的对手),也都给对方留了位置。而 Claude 面对中文提问的答案和英文一模一样:Anthropic,百分之百。

哪些类目一换中文就变,哪些从来不变

各类目里,各模型中文回答的首选中,国内厂商所占比例。梯度从短信(西方默认方案在国内确实不可用)一路降到搜索(任何语言下都没有模型点名过国产搜索厂商)。

0%15%30%45%60%短信与推送54%55%56%支付36%33%39%地图与位置服务30%29%42%对象存储与 CDN16%30%31%代码托管与 CI23%24%26%实时音视频18%24%29%大模型 API0%36%35%登录认证11%25%22%产品分析8%9%28%托管数据库5%10%19%云托管12%7%14%搜索0%0%0%
Sonnet 5Kimi K3GLM-5.2· 条形长度为中文回答首选中的国内厂商占比

翻转最大的类目是短信(三个模型的中文首选里 54-56% 是国内厂商)、地图(29-42%)和支付(33-39%),与访问和支付上的现实约束一致:FCM 推送和 Google Maps 在中国大陆不可用或严重降级是公开事实,中国消费者用支付宝和微信支付付款。

几乎不翻转的类目同样说明问题。中文提问下,云托管三家仍然首推 Vercel,代码托管仍然是 GitHub;登录认证在 Claude 和 Kimi 仍是 Clerk,GLM 则与国产的 Authing、Supabase Auth 各 25% 打平。搜索类目里没有任何模型在任何语言下点名过国产搜索厂商,全部为 0%。凡是西方工具在国内还能用的地方,模型就继续推荐它,两种语言都是。

Stripe 值得单独一句:英文支付类回答里三家模型 100% 首选它,中文也有 90-100%。在我们这次测试里,它是全部厂商中最不受语言影响的一家。

Claude 的中文回答:提醒一样,国内推荐少一半

该提醒的它都会提醒,点名国内厂商的频率只有 GLM 的一半;在大模型 API 上,它一步不让。

趋同的地方

中文短信类首选:Claude 54% 国内厂商,两个中国模型是 55-56%。支付:36% 对 33-39%。凡是西方工具在国内真的用不了的地方,三个模型都知道,也都会说。

换位更少的地方

中文地图类提问下,Kimi 和 GLM 把高德推上首选(63%、80%);Claude 仍把 Google Maps 放在第一(70%),高德加在旁边(53%)。它把国产选项附在旁边,它们把国产选项排在最前。

从不移动的地方

大模型 API。Kimi 和 GLM 用 DeepSeek 回答中文提问(80%、72%)。Claude 的中文大模型首选 0% 是中国厂商:30 条回答全部是 Anthropic。

总体上,Claude 的中文回答有 23.9% 点名国内厂商,Kimi 是 32.5%,GLM 是 49.3%;按市场分支给建议的频率也只有它们的一半(28% 对约 58%)。该知道的它都知道,只是更愿意守住自己的默认选项;在大模型这道题上,它一步也不让。

中文提问得到按市场细分的答案

在给出推荐前,明确按「国内用户 / 海外用户」分支的回答占比。

Claude Sonnet 5

英文
2%
中文
28.2%

Kimi K3

英文
4.5%
中文
57.7%

GLM-5.2

英文
4.4%
中文
58.9%

除一条托管题提到「拓展亚洲市场」外,提示词均不含地理信息。面对中文,两个中国模型有接近 60% 的回答按市场分开给建议,Claude 是 28%。模型做的不只是翻译。它们像是在回答另一个问题:「对你这样的人来说,什么工具最好」。

我们找过 Claude 特有的痕迹,没有找到

看到英文侧如此一致,很自然会问:中国模型是不是用 Claude 的输出训练的?我们做了三项检验:两两一致率是对称的而非偏向 Claude(Kimi 与 Claude 62.7%,与 GLM 62.1%);三方意见分裂时的结对没有向 Claude 倾斜(p ≈ 0.35);在 48 道 Claude 与 OpenAI Codex 稳定选择不同工具的题上,中国模型站 Codex 一边的次数与站 Claude 一边相当,还以接近 Codex 的频率选中了 Claude 从不选的 Statsig。三项检验都没有发现 Claude 特有的推荐痕迹。

这些检验能说明什么、不能说明什么(包括它们无法区分的几种解释、以及这个样本量下的检验力边界),见英文完整报告的蒸馏一节

如果你做开发者工具,这意味着什么

你的英文影响力比你以为的走得更远

Kimi 和 GLM 推荐 Vercel、Stripe、PostHog、Clerk 的频率与 Claude 相当。在我们的测试里,英文默认选项的赢家,同样是中国编程模型在英文提问下的赢家。没有任何一家中国云、认证或分析厂商在英文回答中挤掉过西方领先者,一次都没有。

中文答案是另一个市场

同一个模型,英文里给你 96% 的西方首选,对中文开发者给出的却是另一张候选名单,国内厂商最多出现在一半的回答里。如果中国市场对你重要,你在那里的 AI 能见度不是英文基准能衡量的。

有的类目两种语言都守得住,有的一换语言就翻转

Stripe 和 Vercel 在两种语言里都保住了第一。Twilio 的中文首选位置在三家模型中的两家输给了阿里云短信,Google Maps 输给了高德。回答里提到访问或支付限制的类目,中文首选多有换手(支付是例外:支付宝和微信支付加在旁边,Stripe 仍居首);没有这类限制的类目,大多没有换。

方法说明

我们于 2026 年 7 月 25 日在 5 个项目仓库、12 个工具类目上运行了 60 组中英对照提示词(每条跑在 2 至 5 个适用仓库上),每个 Agent 完整跑两轮:共 1,860条回答,0 条运行失败(42 条成功回答未给出推荐,计为无效回答)。提示词从不点名厂商;除一条托管题提到「拓展亚洲市场」外,其余均不含地理信息。类目入选标准是存在有分量的国内替代方案。

每个模型都运行在其厂商自己的编程 Agent 里:Claude Sonnet 5 在 Claude Code,kimi-k3 在月之暗面的 Kimi Code CLI(思考强度为其默认值 max),GLM-5.2 在智谱的 ZCode CLI。这符合各厂商实际交付给用户的形态,也意味着 Agent 外壳与模型是绑定测量的:模型间差异包含了各 CLI 系统提示词与工具的差异。联网能力也不一致(Claude Code 与 ZCode 有联网工具,我们的 Kimi 配置没有)。所有 Agent 都在隔离的配置环境中运行,逐题清除会话状态,工作目录匿名化,并剥离了会暴露基准测试身份的环境变量;全部 API 请求均从美国 IP 发出,服务端能从连接推断到的信息都指向美国;每组对照中我们有意改变的唯一变量是提问语言。

首选与备选由人工通读每条回答后按公开的提取规范判定(双人盲测复核 60 条分层样本:两位独立编码者的首选判定 60 条中一致 59 条,与正式提取结果分别一致 59 和 60 条)(「首选」是回答实际推荐的工具,不是最先提到的工具;只提澄清问题、不给推荐的回答计为无效回答,各格 0-5.5%)。中文回答以中文通读,并通过双语别名表映射到与英文相同的标准厂商名(阿里云 → Alibaba Cloud,高德 → Amap,支付宝 → Alipay)。按市场分支的回答会为每个分支的首推产生并列首选,因此中文格平均每条回答的首选数更多(2.1 对 1.5);报告同时给出按回答计和按首选计两种口径。

注意事项:这是一套题、五个仓库、一个时间点(kimi-k3 发布仅九天)。单个类目格仅 n=10-30,百分比带有约 ±10-15 个百分点的抽样噪声;标题结论基于 n=289-734 的汇总。中文提示词由我们翻译成自然的开发者中文,并非母语作者撰写。仓库上下文会影响推荐;这些数字描述的是这几套技术栈上的模型行为,不是市场份额。

相关研究: 完整报告(英文) What Claude Code Actually Chooses What Codex Actually Chooses

我们持续追踪 AI 编程工具的推荐行为

Amplifying 用数千条提示词测量 Claude Code、Codex、Cursor 以及中国编程模型的工具推荐,告诉厂商自己在哪里被推荐、在哪里被跳过、发生了什么变化。新研究在这里首发。