动态
4 月开源闭源差距「个位数百分点」· 10 月 Gemini 4 Argon 又超了
4 月开源 vs 闭源在主流 benchmark 差距缩到 <10%。10 月 Gemini 4 Argon / Claude Opus 5.5 重新超越;但 80% 任务开源旗舰够用。
4 月开源闭源差距「个位数百分点」· 10 月 Gemini 4 Argon 又超了
这事很多人没看懂——不是说开源赢了,而是说对 80% 的任务,开源已经够了。
10 月开源 vs 闭源
| 模型 | 厂商 | 类型 | 当前状态 |
|---|---|---|---|
| Gemini 4 Argon | 闭源 | 10/1 发布 · #1 Text Arena | |
| Claude Sonnet 5.5 | Anthropic | 闭源 | 10/2 · 30% 快 30% 便宜 |
| GPT-6.1 Sol | OpenAI | 闭源 | 10/4 · $2/$10 |
| Claude Opus 5.5 | Anthropic | 闭源 | 4 月 |
| Qwen 3.7 | Alibaba | Apache 2.0 | H1 旗舰;Qwen 4 训练中 |
| DeepSeek V4.1 Flash | DeepSeek | MIT | 已发 · 1.6T / 49B active |
| GLM-5.3 | Z.ai | MIT | Anthropic 称"最 cyber-capable" |
| Llama 4.5 Maverick | Meta | Llama Community | Meta 可能不再推下一代 |
| Gemma 4 31B | Apache 2.0 | 干净许可证 |
4 月发生了什么
Thorsten Meyer 4 月那篇《Single Digits》:开源 vs 闭源在主流 benchmark 上差距从 20-30% 缩到「个位数百分点」(< 10%)。
关键不是开源"赢了"——关键是能力追平之后,开源多了三件事:
- ✅ 私有数据不出门(最关键)
- ✅ 调用成本边际 0
- ✅ 可微调 / 可离线 / 可审计
10 月 Gemini 4 Argon 重新超越闭源 leaderboard——但对 80% 任务(写代码 / 翻译 / 总结 / 抽取)开源旗舰够用。
经济账(写代码场景 200 万 tokens/月)
闭源路径:
- Gemini 4 Argon:$2/$10/M × 2M = $20/月 = ¥144/月
- 一年:¥1728
本地路径(Qwen 3.5 27B Q4_K_M):
- 一次性硬件:¥9000(4090 多卡 + 部分 offload)
- 月电费:¥150
- 一年回本 vs Gemini API:约 4 年
- 之后边际 0
三个判断点
1️⃣ 闭源 leaderboard 拉锯≠你用得上。Gemini 4 Argon 的 1M 输出你 90% 用不到 2️⃣ 开源 ≠ 免费。Qwen 3.5 27B ≈ 130GB 装下,4090 单卡跑要分块,真全本地要 64GB+ 卡 3️⃣ Meta 不推下一代这事——开源阵营少一个大型玩家。Qwen / DeepSeek / GLM 顶上
证据分层
- "差距个位数百分点":4 月 thorstenmeyerai 复盘 H1 数据
- "Gemini 4 Argon #1":10/1 Google 官方 + AutomationBench / LVBench 第三方
- "GLM-5.3 cyber-capable":Anthropic 9 月报告措辞
- "Qwen 4 训练中":Alibaba Apsara 10/2 大会
- "Meta 不推下一代":10/2 Apsara + 多家复盘交叉验证