エッジ / ローカル推論エンジン(2026年8月)

極小のハードウェアで巨大モデルを動かすプロジェクト群。共通の手法:MoEのスパース性を活用——
小さな共有コアをRAMに常駐させ、ルーティングされたエキスパート重みを必要に応じてディスクから
ストリーミングする——モデル全体を量子化する代わりに。

パターン

MoEモデルはトークンごとのアクティブパラメータ数が小さく、大部分のエキスパートは遊休状態。
それらのエキスパートをSSD/NVMeからストリーミング(LRU/LFUキャッシュ付き)することで、数兆
パラメータモデルを消費者向けハードウェアのワークロードに変える。「ゼロ量子化、ゼロ蒸留」が
共通のうたい文句。

プロジェクト

メモリ管理の比較

「MoEスパース性」という共通ラベルの下に、実は2つの異なる戦略が隠れている。分けて考える価値が
ある——最適化している制約が違い、失敗の仕方も違う。

A. ストリーミング + キャッシュ(kimi-k3-in-c、TurboFieldfare、h3.cの--ssd-streaming)——
共有コアを常駐させ、ルーティングされたエキスパートを必要に応じてSSD/NVMeからストリーミングし、
ホットなエキスパートをキャッシュする。エキスパートがいくつあってもメモリフットプリントは
平坦なまま。コストは、ルーティング変更後の最初のトークンでのキャッシュミス。

B. アクティブ集合を縮める(Ling-3.0-tiny)——トークンごとのアクティブフットプリントを
十分小さくし(7.9B中の1.3B、KDA:MLA 3:1ハイブリッドアテンション)、全体をRAMに収める。
ディスクストリーミングは一切行わない。総パラメータ数ではなく、レイテンシと決定的なファースト
トークン時間(<100ms)を最適化。

再利用可能な洞察: エンジン選択は規模(Aは任意の数のエキスパートをストリーミングできるが
キャッシュミスのコストを払う)とレイテンシ(BはミスしないがRAMに収まる量に上限がある)の
トレードオフ。キャッシュポリシー(LRU vs LFU、レイヤーごと vs グローバル)がA戦略エンジン同士を
分ける調整可能なノブ。この2戦略が融合するかどうか——より大きなハードウェアでオーバーフローした
エキスパートもストリーミングする「小さい常駐コア」モデル——に注目。