← 新闻
动态

4 月开源闭源差距「个位数百分点」· 10 月 Gemini 4 Argon 又超了

4 月开源 vs 闭源在主流 benchmark 差距缩到 <10%。10 月 Gemini 4 Argon / Claude Opus 5.5 重新超越;但 80% 任务开源旗舰够用。

来源: thorstenmeyerai.com

4 月开源闭源差距「个位数百分点」· 10 月 Gemini 4 Argon 又超了

这事很多人没看懂——不是说开源赢了,而是说对 80% 的任务,开源已经够了。

10 月开源 vs 闭源

模型 厂商 类型 当前状态
Gemini 4 Argon Google 闭源 10/1 发布 · #1 Text Arena
Claude Sonnet 5.5 Anthropic 闭源 10/2 · 30% 快 30% 便宜
GPT-6.1 Sol OpenAI 闭源 10/4 · $2/$10
Claude Opus 5.5 Anthropic 闭源 4 月
Qwen 3.7 Alibaba Apache 2.0 H1 旗舰;Qwen 4 训练中
DeepSeek V4.1 Flash DeepSeek MIT 已发 · 1.6T / 49B active
GLM-5.3 Z.ai MIT Anthropic 称"最 cyber-capable"
Llama 4.5 Maverick Meta Llama Community Meta 可能不再推下一代
Gemma 4 31B Google Apache 2.0 干净许可证

4 月发生了什么

Thorsten Meyer 4 月那篇《Single Digits》:开源 vs 闭源在主流 benchmark 上差距从 20-30% 缩到「个位数百分点」(< 10%)。

关键不是开源"赢了"——关键是能力追平之后,开源多了三件事:

  • ✅ 私有数据不出门(最关键)
  • ✅ 调用成本边际 0
  • ✅ 可微调 / 可离线 / 可审计

10 月 Gemini 4 Argon 重新超越闭源 leaderboard——但对 80% 任务(写代码 / 翻译 / 总结 / 抽取)开源旗舰够用。

经济账(写代码场景 200 万 tokens/月)

闭源路径:

  • Gemini 4 Argon:$2/$10/M × 2M = $20/月 = ¥144/月
  • 一年:¥1728

本地路径(Qwen 3.5 27B Q4_K_M):

  • 一次性硬件:¥9000(4090 多卡 + 部分 offload)
  • 月电费:¥150
  • 一年回本 vs Gemini API:约 4 年
  • 之后边际 0

三个判断点

1️⃣ 闭源 leaderboard 拉锯≠你用得上。Gemini 4 Argon 的 1M 输出你 90% 用不到 2️⃣ 开源 ≠ 免费。Qwen 3.5 27B ≈ 130GB 装下,4090 单卡跑要分块,真全本地要 64GB+ 卡 3️⃣ Meta 不推下一代这事——开源阵营少一个大型玩家。Qwen / DeepSeek / GLM 顶上

证据分层

  • "差距个位数百分点":4 月 thorstenmeyerai 复盘 H1 数据
  • "Gemini 4 Argon #1":10/1 Google 官方 + AutomationBench / LVBench 第三方
  • "GLM-5.3 cyber-capable":Anthropic 9 月报告措辞
  • "Qwen 4 训练中":Alibaba Apsara 10/2 大会
  • "Meta 不推下一代":10/2 Apsara + 多家复盘交叉验证