新闻
本地 AI 的模型、硬件与运行动态——新发布、榜单变化与部署指南。
新闻
中国开源模型首次进入 OpenAI 企业结算体系:Kimi K3、GLM 5.3 接入 Codex 企业通道
据多家中文媒体报道,Baseten 成为 OpenAI B2B 市场首批开源模型推理服务商:企业可在 Codex / Responses API 中调用 Kimi K3、GLM 5.3,费用计入既有 OpenAI 采购承诺额度——中国开源模型首次进入 OpenAI 企业付费结算体系。
发布三周,DeepSeek V4.1 Flash 衍生生态成形:GGUF 量化、abliterated 与 FP8 社区版
得益于 MIT 许可,DeepSeek V4.1 Flash 发布数小时内社区衍生版即上线:abliterated 全精度版、GGUF 本地量化版、FP8 uncensored 版(下载量最高)相继出现,另有 MixedQ2 混合量化与 forgequant 量化工具。官方未参与或背书任何衍生版本。
蚂蚁百灵发布 Ling-3.1-flash:560B 总参数 / 25B 激活,连续 17 小时写出编译器
蚂蚁百灵(InclusionAI)发布 Ling-3.1-flash:约 560B 总参数、25B 激活,混合线性注意力架构,1M 上下文(体验期 256K);官方演示连续 17 小时从零写出 Lua 到 x86-64 编译器(182 项测试过 178)。目前未开源,官方称转付费后计划开源。
OpenAI DevDay 2026:GPT-6.1 Sol 发布——逼近旗舰实力,价格五分之一
OpenAI 在 DevDay 2026 发布 GPT-6.1 Sol(gpt-6.1-sol):输入 $2/输出 $10 每百万 token,约为 GPT-6 Astra 的五分之一,1.05M 上下文,已成 Codex 默认模型;同场发布 dots 智能体、Pro 500 套餐与 Agents API。此前一天,GPT-6.1 Astra 因内部对齐测试未通过被搁置。
谷歌发布 Gemini 4(Argon):安全优先的分阶段开放
谷歌发布新一代旗舰 Gemini 4 Argon,主打复杂长周期工作流中的持续深度推理;采取分阶段发布策略,初期仅向可信赖的网络安全防御人员开放,评测与定价均未披露。
Anthropic 发布 Claude Opus 5.5:$4/$20 定价,旗舰门槛再降
Anthropic 发布 Claude 5.5 系列首款模型 Opus 5.5(claude-opus-5-5):输入 $4/输出 $20 每百万 token,较 Opus 5 降价 20%,1M 上下文,官方称多数工作负载达到 Fable 5.1 水平而价格不到一半;Sonnet 5.5 六天后跟进。
阿里发布 Qwen3.8-Omni-Flash:1M 上下文原生全模态,音频成本降 98%
阿里千问发布 Qwen3.8-Omni-Flash:基于 Qwen3.8-Flash-Next 架构的原生全模态模型,支持文本/图像/音频/视频输入与 1M 上下文,输入 $0.15/百万 token,每小时音频输入成本较上代降超 98%;仅 API 提供,未开放权重。
小米开源 MiMo-V2.6:Pro 版登顶 Artificial Analysis 开放权重榜
小米发布并开源 MiMo-V2.6 系列(完全开放权重):分 Pro / Flash / Ultraspeed 三档并附桌面客户端,全系原生全模态;据行业日报报道,Pro 版登顶 Artificial Analysis 开放权重模型榜,分数高于 Kimi K3 与 Qwen3.8 Max。
DeepSeek V4.1 Flash 开源:每 token KV Cache 仅 890 字节,百万上下文不再昂贵
DeepSeek 发布并开源 V4.1 Flash(MIT 许可):552B 非对称 MoE,每 token 全局 KV Cache 仅 890 字节、约为上代 1/4,1M 上下文 KV 仅约 890MB;Agent 基准超越 V4 Pro,API 输入 $0.30/百万 token、闲时半价。
llama.cpp 手动部署
下载 GGUF、自选量化与参数,理解每一步在做什么——可控性与性能天花板都更高。
共 11 篇