决策问答 Q2:国产模型有没有戏?

[P3 决策问答 模型竞争 中西方格局]
126 字

决策问答 Q2:国产模型有没有戏?

形式:数据证据 → 判断 → 行动建议。证据来自本 wiki 语料,口径见来源页。


问题

中文语料里"国产能不能打"是持续底噪。从 2026 年 3-8 月的数据看,国产模型到底处于什么位置?

数据证据

证据 来源
海外模型组命中率均值 137.5 vs 国产组 81.4(分组求和,非直接对等) 2026-08-comparisons/模型竞争对比
单模型最高关注度:Anthropic 48%(均值)、OpenAI 35%、Gemini 33%——全是海外 同上
国产最高:Kimi 末值 27.8%、DeepSeek 末值 25.3%——第一梯队 同上
Meta(Llama) 从 36.7% 跌到 11.4%:开源叙事交接给 Kimi/DeepSeek 同上
中国独特叙事:Token 价格战("20万字不到1分钱")、K3 开源引发英伟达蒸发 2026-08-11-P1-中西方AI格局双视角

判断

  1. "有没有戏"是错误的问题——国产的戏在"重新定义价格",不在"追平模型"。语料里国产模型的存在感不是靠"能力追平 GPT-5",是靠 K3/DeepSeek 把 Token 价格打下来、引发英伟达市值波动。国产已经在定义"模型商业化"这个赛道,而不是在别人赛道里追赶。
  2. 国产第一梯队只有两家:Kimi 和 DeepSeek。Kimi 靠 K3 开源回潮(末值 27.8%),DeepSeek 靠价格战心智(末值 25.3%)。Qwen 高开低走(40%→11%),说明阿里云的模型本体关注度在稀释——阿里叙事重心在云和办公 Agent,不在模型本身
  3. "国产替代"叙事已升级为"国产定价"叙事——从"能不能打"(能力)到"打多少折"(价格)。这个转变对下游是利好(Token 便宜),对上游模型公司是血战。
  4. 西方模型仍是参照系,但没有一个月国产接近西方顶部。语料默认"OpenAI/Anthropic 是能力天花板"。

行动建议

  • 用国产模型:如果你做 Agent/应用,国产第一梯队(Kimi/DeepSeek)的成本优势是真实的,性价比高于海外——这正是语料里价格战叙事的落点
  • 别押国产"追平"叙事:语料没有证据显示国产在模型能力上追平海外,押这个方向容易失望
  • 关注国产的两个转折点:①Kimi K3 之后的下一轮开源(开源→闭源路线摇摆);②国产模型在"办公 Agent 生态"的绑定(钉钉/飞书是否深度接入国产模型)
  • 警惕:Token 价格战是双刃剑——语料里已经有"豆包收费哪来的底气"的反问,低价可持续性存疑

诚实声明

  • 语料主体是中国媒体视角,对国产模型的报道存在系统性乐观偏差(本土媒体倾向报道国产进步)
  • "分组求和"(海外 4 个 term vs 国产 6 个 term)不可直接对等,单模型数据才可信
  • 没有评测数据,命中率≠能力——本问答只谈"语料里的位置",不谈"模型真实能力"

关联