前沿模型经济学(2026 年 8 月)

截至 2026 年 8 月趋势窗口的前沿 LLM 竞争格局:开源权重与闭源模型之间的基准差距持续缩小,而
价格差距依然巨大——"推理质量"不再是护城河;分发与集成速度才是。

8 月 13 日的双重发布

形态

三个闭源前沿锚点(Claude Fable 5、GPT-5.6 Sol、Grok 4.6)与一个快速崛起的开源权重梯队
(DeepSeek V4 Pro、Motif 3、Qwen-Max 级),如今在 agentic 基准上只差几分,却横跨巨大的输入价格
区间。"推理质量是护城河"正在失效;前沿是一场围绕价格 + 分发 + 工具集成展开的多方竞赛。

Qwen-Max 走向开源(8 月 14 日)

Qwen3.8-2.4T-A95BQwen/Qwen3.8-2.4T-A95B — 是阿里首个完全开源的 Qwen-Max 级(旗舰)
模型。一个细粒度 MoE,2.4T 总参数 / 约 95B 活跃参数,每层 512 个专家(10 个路由 + 1 个共享),
混合 Gated-DeltaNet + Gated-Attention,并采用多 token 预测训练。原生 262K 上下文(可扩展到约
1M);开源版本为纯文本、强制开启思考。自报基准:Terminal-Bench 2.1 86.6、PaperBench 93.0、
GPQA Diamond 92.6、SWE-bench Pro 67.7。权重(约 4.9TB BF16)以自定义 Qwen3.8-Max 许可发布在
Hugging Face + ModelScope;NVIDIA 博客展示了它在 GB300 NVL72 机柜上以 FP8 每 GPU 4,000+ tok/s
经 vLLM/SGLang/TokenSpeed 提供推理。

这补上了能力曲线最顶端的开源 vs 闭源差距:一个可下载的 Qwen-Max 级模型,改变了那些此前只能
调用阿里 API 的团队在微调与自托管上的经济学。它是 8 月形态迄今最强的实例——中国实验室交付前沿
规模开源权重(DeepSeek V4 Pro、Qwen-Max 级),而美国实验室交付更小、更快的闭源模型。

定价(2026-08-13 已核实)

feed 的"约 1/46 价格"标题是错的,已更正为"输入约 1/23"。已对照一手来源核实——DeepSeek 定价页
DeepSeek-V4-Pro-0813)与 Anthropic 公布的 Fable 5 价格:

TokenDeepSeek V4 ProClaude Fable 5Fable 5 ÷ V4 Pro
输入(cache miss)$0.435/M$10/M约 23×
输出$0.87/M$50/M约 57×
输入(cache hit)$0.003625/M$1/M约 276×

可辩护的标题是输入约便宜 23×——正是正文自己的"$0.435 vs $10"。输出约便宜 57×。"46×"这个数字
对不上任何一个:这正是 fact-check 方法要防范的那类 Void 式失败——一个从未指向来源的标题数字。
feed 标题已更正(en/zh/jp)。

开源权重越出美中

安全门槛(一条新的前沿约束)

OpenAI 暂停了未发布的前沿模型 Astra,因为其自有的 Preparedness Framework 得出结论"无法排除
Critical 能力"——这是第一个触顶最高等级的模型(可独立发现零日漏洞、无需人类指令即可端到端执行
网络攻击)。开发现在只在隔离沙箱中进行,配以受限的网络/工具访问、权重加密与思维链监控。这是对
"推理质量不再是护城河"的活体检验:在最高端,攻击性网络能力是如今决定能否发布的门槛。由 PCMag /
InfoSecurity 报道(二手来源);OpenAI 自身的声明此处尚未一手确认。

这只是一个实验室的一次实例,背后是跨实验室收敛的形态。OpenAI PF v2(两档——"High" 与
"Critical")、Anthropic RSP v3.0(ASL-1 → ASL-5+ 生物安全等级式分级,2026 年 2 月 24 日生效)与
Google DeepMind FSF v3.1(Critical Capability Levels,现又新增用于更早、较轻信号的 Tracked
Capability Levels)都在跑同一个循环——能力门槛 → 评估 → 预先承诺的应对。它也在走向法定化
加州 SB 53(2026 年 1 月 1 日生效)要求大型开发者发布并遵守前沿安全框架,欧盟 AI 法案为通用 AI
增加了系统性风险义务。共同的保留项:三者都带有"竞争对手调节条款"——若同行在无对等防护下发布,
实验室可降低自身防护——这是对门槛机制的反向拉力,可能导致向下竞赛。

谁度量这一门槛(已回答,8 月 14 日)。 SB 53 即《前沿 AI 透明法案》(TFAIA;2025 年 9 月 29 日
签署,2026 年 1 月 1 日生效):前沿开发者的安全框架必须描述"使用第三方评估灾难性风险的可能性与
缓解措施的有效性",且每次部署前的透明度报告必须说明"第三方评估者参与的程度"。因此第三方度量正在
出现——但它是针对各实验室自发布框架执行的披露义务(每次违规最高 100 万美元民事罚款),而非
共享的外部地板。执法问的是"你是否遵守了自己的框架",而非"你是否错过了共享门槛"。剩下的缺口是
跨实验室的度量标准。

隐藏推理可被提取(8 月 14 日)

arXiv:2608.09867——《Stealing Reasoning Traces from Proprietary LLM APIs》(Panfilov 等)——是一
项前沿安全发现,而非经济学发现,但它落在同一个窗口内:专有 API 返回的加密"推理块"(用于隐藏
思维链同时让客户端渲染它)在同一供应商内的会话、用户与模型之间完全可互换。作者利用这一点,
将能力更强模型的加密轨迹注入同供应商一个更弱、防护更少的模型,迫使其逐字解码该轨迹——无需直接
越狱强模型。已演示的向量:

结论是架构性的:如果块是任何同族模型都会解密的可互换令牌,那么按块加密推理毫无意义;修复方法
是把推理绑定到其会话(论文负责任披露中给出的密码学 + 系统级缓解)。"隐藏 CoT" 是三大实验室全都
违反的保密假设,而非保护边界。

关注点