フロンティアモデル経済(2026年8月)
2026年8月のトレンドウィンドウ時点のフロンティアLLM競争:オープンウェイトとクローズドモデルの
ベンチマーク差は縮まり続ける一方、価格差は依然として巨大——「推論品質」はもはや堀ではなく、
流通と統合の速さこそが堀。
8月13日のダブルヘッダー
- DeepSeek V4 Pro GA —
DeepSeek-V4-Pro-0813が一夜でプレビューからGAへ昇格。エージェント 級の機構(JSON構造化出力、ツール呼び出し、Responses API、Anthropic互換API、Codex統合)、 1Mトークンのコンテキスト、最大384Kの出力を追加。DeepSeekのベンチマーク表:10のエージェン ティックベンチマークでAnthropic Claude Fable 5の約5%以内に迫り、Cybergym(83.3 vs 83.1)と AutomationBench(31.8 vs 29.1)では上回る。最大の伸びはDeepSWE(長時間ソフトウェア工学、 12.8 → 62.7)。自己申告のハーネス。DSBench-FullStack/Hardは社内ベンチマーク → 第三者検証待ち。 - xAI Grok 4.6 — 長時間稼働エージェントと視覚/対話作業向けに調整され、長い軌道での自己検証 が向上。Artificial Analysis Intelligence Index は 61 で GPT-5.6 Sol Max と同水準(61 vs 62)。 CursorBench v3.2 約69.9%、DeepSWE v1.1 約65.9%。API + OpenRouter/Vercel/Cloudflare 経由で 入力$2/M、出力$6/M。プロプライエタリ、オープンウェイトは未発表。
パターン
3つのクローズドフロンティアのアンカー(Claude Fable 5、GPT-5.6 Sol、Grok 4.6)と、急速に台頭する
オープンウェイトの階層(DeepSeek V4 Pro、Motif 3、Qwen-Max級)が、エージェンティックベンチマーク
で数ポイント差で並ぶ一方、入力価格には巨大な開きがある。「推論品質が堀」は崩れつつあり、フロン
ティアは価格 + 流通 + ツール統合をめぐる多方向の競争。
Qwen-Maxがオープンに(8月14日)
Qwen3.8-2.4T-A95B — Qwen/Qwen3.8-2.4T-A95B — は、アリババ初の完全オープンソース化された
Qwen-Max級(フラッグシップ)モデル。細粒度MoEで、総2.4T / アクティブ約95Bパラメータ、層
あたり512エキスパート(ルーテッド10 + 共有1)、ハイブリッドなGated-DeltaNet + Gated-Attention、
マルチトークン予測トレーニング。ネイティブ262Kコンテキスト(約1Mまで拡張可能)。オープンビルド
はテキストのみで思考は常時オン。自己申告ベンチ:Terminal-Bench 2.1 86.6、PaperBench 93.0、GPQA
Diamond 92.6、SWE-bench Pro 67.7。ウェイト(約4.9TB BF16)はカスタムQwen3.8-Maxライセンスで
Hugging Face + ModelScopeに公開。NVIDIAブログはGB300 NVL72ラック上でFP8・GPUあたり4,000+ tok/s、
vLLM/SGLang/TokenSpeed経由での提供を示す。
これは能力曲線の最上位でオープン vs クローズドの差を埋める:ダウンロード可能なQwen-Max級モデル
は、これまでアリババのAPIを呼ぶしかなかったチームのファインチューニング/セルフホスティングの
経済性を変える。8月のパターンのこれまでで最強の実例——中国ラボがフロンティア規模のオープン
ウェイトを出荷し(DeepSeek V4 Pro、Qwen-Max級)、米国ラボがより小さく高速なクローズドモデルを
出荷する。
価格(2026-08-13 検証済み)
フィードの「約1/46の価格」という見出しは誤りで、「入力約1/23」に訂正済み。一次情報で検証——
DeepSeekの価格ページ(DeepSeek-V4-Pro-0813)とAnthropicの公表Fable 5価格:
| トークン | DeepSeek V4 Pro | Claude Fable 5 | Fable 5 ÷ V4 Pro |
|---|---|---|---|
| 入力(キャッシュミス) | $0.435/M | $10/M | 約23× |
| 出力 | $0.87/M | $50/M | 約57× |
| 入力(キャッシュヒット) | $0.003625/M | $1/M | 約276× |
擁護できる見出しは入力で約23×安い——まさに本文自身の「$0.435 vs $10」。出力は約57×安い。
「46×」という数字はどちらにも遡れない:fact-check メソッドが防ごうとするVoid級の失敗——
ソースを指さない見出しの数字。フィード見出しは訂正済み(en/zh/jp)。
オープンウェイトが米中を超える
- Motif 3 —
Motif-Technologies/Motif-3-Beta(韓国のMotif Technologies)、MIT(instruct + base)。 ゼロから作られたスパースMoE:総約314B / アクティブ約13.2B、384のルーテッドエキスパート(top-8)、 ネイティブ256Kコンテキスト、約12.5Tトークンの事前学習、768基のNVIDIA B200 GPUで約5か月訓練。 独自コンポーネント(Grouped Differential Latent Attention、Grouped PolyNorm、多様体制約ハイパー コネクション)——Llama/Qwenの再パラメータ化ではない。Artificial Analysis Intelligence Index 47: 世界9位、オープンウェイト4位、米中以外で1位。SWE-bench Verified 76.2、Terminal-Bench 74.9。 フロンティアは寛容なライセンスの下でオープンウェイトの第三極を得た。
安全の閾値(新たなフロンティア制約)
OpenAIは未公開のフロンティアモデル Astra を停止した。自社のPreparedness Frameworkが「Critical
能力を排除できない」と結論したためで、これは最高ティアに達した最初のモデル(人間の指示なしに
ゼロデイを独自発見し、エンドツーエンドのサイバー攻撃を実行)。開発は今や、ネットワーク/ツール
アクセスを制限し、重み暗号化と思考連鎖モニタリングを備えた隔離サンドボックスでのみ進行する。
「推論品質はもはや堀ではない」の生きた検証:最上位では攻撃的サイバー能力がリリースをゲートする
閾値になっている。PCMag / InfoSecurityによる報道(二次ソース);OpenAI自身の声明はここでは未確認。
これは一つのラボの一事例だが、背後にはラボ横断で収束した形状がある。OpenAI PF v2(「High」と
「Critical」の2閾値)、Anthropic RSP v3.0(ASL-1 → ASL-5+ のバイオセーフティ型レベル、2026年2月24日
施行)、Google DeepMind FSF v3.1(Critical Capability Levels、さらに早期の軽微なシグナル向けに
Tracked Capability Levels を追加)はすべて同じループ——能力閾値 → 評価 → 事前コミットされた対応——
を回す。そして法制化も進む:カリフォルニア州SB 53(2026年1月1日施行)は大規模開発者にフロン
ティア安全フレームワークの公表と遵守を義務づけ、EU AI法は汎用AIにシステムリスク義務を課す。共通の
留保:3つすべてに「競合調整条項」があり——他社が同等の保護なしで出荷した場合、ラボは保護を下げられ
る——これはゲーティングへの底辺への競争という逆作用になり得る。
誰が閾値を測定するか(回答、8月14日)。 SB 53はTransparency in Frontier AI Act(TFAIA;2025年
9月29日署名、2026年1月1日施行):フロンティア開発者のフレームワークは「第三者を用いた破局的
リスクの可能性と緩和策の有効性の評価」を記述しなければならず、配備前の透明性報告書は毎回「第三者
評価者の関与の程度」を明記しなければならない。つまり第三者の測定は現れつつある——が、それは各
ラボの自己公表フレームワークに対して執行される開示義務(違反1件あたり最大100万ドルの民事罰)
であり、共有の外部フロアではない。執行が問うのは「自分のフレームワークに従ったか」であって「共有
の閾値を逃したか」ではない。残るギャップはラボ横断の測定標準。
隠れた推論は抽出可能(8月14日)
arXiv:2608.09867——「Stealing Reasoning Traces from Proprietary LLM APIs」(Panfilovら)——は経済
学ではなくフロンティアセキュリティの知見だが、同じウィンドウに落ちる:専有APIが返す暗号化
「reasoning blocks」(思考連鎖を隠しつつクライアントに描画させるためのもの)は**同一プロバイダ内の
セッション・ユーザー・モデルをまたいで完全に互換**。著者らはこれを悪用し、高性能モデルの暗号化
トレースを同一プロバイダのより弱く防御の薄いモデルへ注入し、そのトレースを逐語的にデコードさせる
——強モデルを直接ジェイルブレイクする必要はない。実証されたベクトル:
- 蒸留防止の回避——Anthropic・OpenAI・Googleから専有推論を抽出。
- プライベートデータの回収——公開リポジトリから収集した315,320個の推論ブロックをデコードし、 367件のPIIと182個の認証情報を回収。
- 有害コンテンツの開示——「安全な」最終拒否の背後で危険な推論が露出。
- 不可視のプロンプトインジェクション——暗号化ブロックに埋め込んだ悪性ペイロードでエージェント システムを汚染。
結論はアーキテクチャ的:ブロックがどの兄弟モデルも復号する代替可能なトークンなら、ブロック単位
の推論暗号化は無意味。修正は推論をそのセッションにバインドすること(論文の責任ある開示による
暗号学的 + システムレベルの緩和)。「隠れたCoT」は、上位3ラボすべてが破った機密性の仮定であり、
保護境界ではない。
注視点
- DeepSeek V4 Proの主張に対する第三者(非ベンダー)評価——2つの社内ベンチマーク (DSBench-FullStack/Hard)が留保条件。
- オープンウェイトモデルが長時間SWE(DeepSWE)の残りの数ポイントを埋めるか——単一リリースで最も 動いたベンチマーク。
- 価格競争の二階微分:入力約$0.435/Mが新たな底値になれば、クローズドラボは約$10/Mを生の品質で はなく流通とエンタープライズ信頼で正当化しなければならない。
- Motif 3のMITウェイトが第三者評価(自社引用のAA Indexだけではない)に耐えるか。
- 「Critical能力」ゲーティング(OpenAI/Astra)が事実上のリリース標準として広がるか——SB 53が「誰が 測定するか」の回答を提供(開示ベースの第三者評価);残るギャップはラボ横断の測定標準、そして 法的開示が自主的フレームワークを置き換えるか。
- どのプロバイダが推論ブロックのセッションバインディング修正を最初に出荷するか(arXiv:2608.09867) ——そしてそれが隠れた思考連鎖のクロスベンダー標準になるか。
- QwenのカスタムQwen3.8-Maxライセンス + 約4.9TBウェイトが実際に大規模にファインチューニング/ ダウンロードされるか——オープンウェイトは、エコシステムがそれを動かせて初めて経済性を変える。