StrataはVRAM 12GBのゲーミングPCで125BのQwenを動かすOSS、毎秒94トークン

3行でわかる
- Strataは、1250億パラメーターのQwen3.8-Flash-NextをVRAM 12GB以上のNVIDIAかAMDのGPUを積んだWindows・Linux機で動かすオープンソースの推論エンジン
- 作者の計測では、RTX 5070とメモリ64GBのPCで毎秒53〜94トークンを生成し、OpenAI互換とAnthropic互換のAPIでClaude Codeなどにもつなげられる
- Strataは公開から10日でGitHubのスターが8500を超えたが、r/LocalLLaMAでは宣伝投稿が多すぎるとの不満も出ており、数字は作者と利用者の自己計測が中心
GitHubのユーザーNiko1221が公開した推論エンジン「Strata」が、ローカルLLMの利用者の間で広がっています。1250億パラメーターのAlibabaのモデルQwen3.8-Flash-Nextを、VRAM 12GBのグラフィックカードを積んだ普通のゲーミングPCで動かし、作者の計測ではRTX 5070で毎秒94トークンを生成します。リポジトリは米国時間9月24日に作られ、10月4日時点でGitHubのスターは8500を超えました。
何を作ったか
Strataとは、Qwen3.8-Flash-Nextを家庭用のPCで動かすことに絞った、MITライセンスのオープンソースの推論エンジンです。対応するのはWindowsとLinuxで、NVIDIAのGeForce RTX 20〜50シリーズか、AMDのRadeon RX 7000・9000シリーズなど、VRAM 12GB以上のGPUが条件です。メインメモリは32GB以上、ディスクは約80GBを求めます。
It chats, writes code, reads pictures and works with your apps and coding agents, and nothing leaves your PC.
チャットし、コードを書き、画像を読み、手元のアプリやコーディングエージェントとも連携します。データはPCの外に一切出ません。
原文を読む(github.com)起動するとブラウザで http://127.0.0.1:8080 のチャット画面が開き、同じアドレスでOpenAI互換とAnthropic互換のAPIが立ち上がります。READMEには、環境変数 ANTHROPIC_BASE_URL を書き換えてClaude Codeの接続先をStrataにする例が載っています。考える深さを4段階で切り替えられ、セットアップ時に選べば画像も読めます。
導入はWindowsなら START-HERE.bat をダブルクリックするだけです。インストーラーがGPUとメモリを調べ、入るサイズのモデル(約70GB)を落として起動します。Claude CodeやCursorなどのAIに「この手順書に従って入れて」とURLを渡す導入方法も用意されています。
どう動かしているか
Qwen3.8-Flash-Nextは、Hugging Faceのモデルページによると総パラメーター1250億のうち、1トークンごとに動くのは約60億だけのMoE(Mixture of Experts、専門家の混合)モデルです。Strataはこの「毎回ごく一部しか使わない」性質を使い、計算の置き場所をPC全体に割り振ります。
置き場所は3段構えです。容量の大きいSSDには大きな参照用の表を置き、メインメモリには専門家を全部載せます。そのうち呼ばれる回数が多い数千個だけをGPUに常駐させ、GPUに無い専門家はCPUがGPUと同時並行で計算します。
速度を稼ぐもう1つの工夫が投機的デコードです。小さな補助モデルが次の数語を先に書き、本体のモデルがそれをまとめて検証します。READMEによると、出力の中身は変わらず、1.6〜1.8倍速く答えが出ます。
モデルは2ビット前後まで圧縮した版を使います。圧縮版はISTA-DASLabやUnslothなどが作ったもので、エンジンの一部にはllama.cppのライブラリを使っているとREADMEに明記されています。数日前に紹介したSlipstreamがMac専用でSSDから重みを読み出すのに対し、StrataはWindowsのゲーミングPCに多い「VRAMは少ないがメモリは積める」構成に合わせています。
成果(作者と利用者の公表値)
作者がRTX 5070(12GB)、Ryzen 5 7600、メモリ64GBのPCで測った生成速度は次のとおりです。
| サイズ | 回答の生成 | プロンプトの読み込み |
|---|---|---|
| Q2_0(最速) | 毎秒94トークン | 毎秒2650トークン |
| IQ2_XS(64GB機の推奨) | 毎秒79トークン | 毎秒2090トークン |
| IQ3_S(最も高品質) | 毎秒53トークン | 毎秒1620トークン |
| Coder(コード特化) | 毎秒55トークン | 毎秒2180トークン |
(出典:StrataのREADME。AMDのRX 9070 XTでは毎秒44〜60トークン)
r/LocalLLaMAには利用者の報告も並んでいます。RTX 3090を2枚とメモリ96GBの環境で毎秒80〜110トークン出たという投稿や、Radeon RX 7900 XTXとDDR4メモリの環境で毎秒45〜70トークンになり、同じ機械で調整したllama.cppの毎秒約22.5トークンを上回ったという投稿があります。
反応と論点
広がり方には反発もあります。r/LocalLLaMAには「ボットがStrataを褒める投稿ばかりだ」と不満をぶつけるスレッドが立ちました。別の投稿では、Strataのように1つのモデルや1種類のハードに絞って最適化した推論エンジンが次々に出ていると指摘し、汎用のllama.cppやvLLMとの役割分担を論じています。
READMEも制約を隠していません。同時に処理できるのは1件の依頼だけで、会話の最初のメッセージは3万トークンあたり約1分かけて読み込みます。モデルの起動中は1〜3分ほどPCが重くなる、または反応しなくなるとも書いています。
日本のビジネスへの影響
必要なのは、VRAM 12GB以上のGPUとメモリ32GB以上(推奨64GB)を積んだWindowsかLinuxのPCです。日本語の性能についてREADMEに記載はなく、Qwen3.8-Flash-Nextのモデルページにも日本語の評価は見当たりません。注意したいのはコード特化のCoder版で、READMEは中国語を含むCJK(中国語・日本語・韓国語)の文章が弱いとして、それらには通常版を勧めています。日本語で使うならQ2_0かIQ2_XS、IQ3_Sを選びます。
向いているのは、ソースコードや顧客資料を社外のAIに送れない会社の開発者と情報システム担当です。社内にある開発用やゲーム用のPC 1台で、100B級のモデルをAPIとして立てられます。今すぐやれることは、メモリ64GBのPCにIQ2_XS版を入れ、Claude Codeの接続先をStrataに替えて、普段のコード修正を数件クラウドのモデルと比べることです。
注意点は3つあります。まず、エンジンはMITですが、モデルにはQwenのコミュニティライセンスなど別の条件が付くので、商用で使う前に確かめます。次に、1件ずつしか処理できないため、部署で共有するサーバーには向きません。最後に、速度の数字は作者と利用者の自己計測で、正確さを第三者が比べた結果はまだありません。手元で動かす選択肢全体はローカルLLM・オープンウェイトモデルのおすすめで比べています。
一次情報
- 公式ドキュメントGitHub Niko1221Niko1221/Strata(README)
- 公式ドキュメントGitHub Niko1221How Strata works
- 公式ドキュメントHugging Face QwenQwen/Qwen3.8-Flash-Next
- コミュニティReddit r/LocalLLaMAStrata Qwen 3.8 flash next is the biggest thing since the release of Qwen 3.8 27b
- コミュニティReddit r/LocalLLaMAAnyone sitting on a lot of slow system memory and a modest GPU.. try Strata + Qwen3.8 Next.
- コミュニティReddit r/LocalLLaMAYes bots we get it, Strata is good now please stop
- コミュニティReddit r/LocalLLaMAThe Rise of Overfit Inference Engines
AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。