决策问答 Q2:国产模型有没有戏?
决策问答 Q2:国产模型有没有戏?
形式:数据证据 → 判断 → 行动建议。证据来自本 wiki 语料,口径见来源页。
问题
中文语料里"国产能不能打"是持续底噪。从 2026 年 3-8 月的数据看,国产模型到底处于什么位置?
数据证据
| 证据 | 来源 |
|---|---|
| 海外模型组命中率均值 137.5 vs 国产组 81.4(分组求和,非直接对等) | 2026-08-comparisons/模型竞争对比 |
| 单模型最高关注度:Anthropic 48%(均值)、OpenAI 35%、Gemini 33%——全是海外 | 同上 |
| 国产最高:Kimi 末值 27.8%、DeepSeek 末值 25.3%——第一梯队 | 同上 |
| Meta(Llama) 从 36.7% 跌到 11.4%:开源叙事交接给 Kimi/DeepSeek | 同上 |
| 中国独特叙事:Token 价格战("20万字不到1分钱")、K3 开源引发英伟达蒸发 | 2026-08-11-P1-中西方AI格局双视角 |
判断
- "有没有戏"是错误的问题——国产的戏在"重新定义价格",不在"追平模型"。语料里国产模型的存在感不是靠"能力追平 GPT-5",是靠 K3/DeepSeek 把 Token 价格打下来、引发英伟达市值波动。国产已经在定义"模型商业化"这个赛道,而不是在别人赛道里追赶。
- 国产第一梯队只有两家:Kimi 和 DeepSeek。Kimi 靠 K3 开源回潮(末值 27.8%),DeepSeek 靠价格战心智(末值 25.3%)。Qwen 高开低走(40%→11%),说明阿里云的模型本体关注度在稀释——阿里叙事重心在云和办公 Agent,不在模型本身。
- "国产替代"叙事已升级为"国产定价"叙事——从"能不能打"(能力)到"打多少折"(价格)。这个转变对下游是利好(Token 便宜),对上游模型公司是血战。
- 西方模型仍是参照系,但没有一个月国产接近西方顶部。语料默认"OpenAI/Anthropic 是能力天花板"。
行动建议
- 用国产模型:如果你做 Agent/应用,国产第一梯队(Kimi/DeepSeek)的成本优势是真实的,性价比高于海外——这正是语料里价格战叙事的落点
- 别押国产"追平"叙事:语料没有证据显示国产在模型能力上追平海外,押这个方向容易失望
- 关注国产的两个转折点:①Kimi K3 之后的下一轮开源(开源→闭源路线摇摆);②国产模型在"办公 Agent 生态"的绑定(钉钉/飞书是否深度接入国产模型)
- 警惕:Token 价格战是双刃剑——语料里已经有"豆包收费哪来的底气"的反问,低价可持续性存疑
诚实声明
- 语料主体是中国媒体视角,对国产模型的报道存在系统性乐观偏差(本土媒体倾向报道国产进步)
- "分组求和"(海外 4 个 term vs 国产 6 个 term)不可直接对等,单模型数据才可信
- 没有评测数据,命中率≠能力——本问答只谈"语料里的位置",不谈"模型真实能力"