2026年10月5日(月) 海外のAIニュースを、日本語で最速に。 最終更新

海外のAI一次情報を、毎日日本語で。

活用事例一次情報

Slipstreamは64GBのMacで95.5GiBのQwenを動かすOSS、llama.cppの1.76倍の速さ

画像はAIで生成したイメージです

3行でわかる

  1. Slipstreamは、メモリより大きいMoEモデルの重みをSSDから必要な分だけ読み込み、64GBのMacで動かすC++とMetal製の推論エンジン
  2. 作者の計測では、95.5GiBのQwen3.8-Flash-Nextを毎秒41〜52トークンで生成し、llama.cppの改造版より平均1.76倍速い
  3. OpenAI互換のAPIで社内のコーディングエージェントにもつなげられるが、検証はM5 Pro搭載のMacBook Pro 1台だけ

GitHubのユーザーnpanjが、メモリに収まらない大きな言語モデルをMacで動かす推論エンジン「Slipstream」をオープンソースで公開しました。95.5GiB(約103GB)あるAlibabaのQwen3.8-Flash-Nextを、メモリ64GBのMacで毎秒41〜52トークンの速さで動かせるとしています。作者は米国時間10月1日、Redditのローカル LLM 系コミュニティr/LocalLLaMAで公開を告知しました。

何を作ったか

Slipstreamとは、Apple Silicon(Mチップ)のMac専用に、C++とAppleのGPU向け言語Metalで書かれた推論エンジンです。ふつう、モデルを動かすには重みをすべてメモリに載せる必要があり、64GBのMacに約100GBのモデルは入りません。Slipstreamは、入りきらない分をSSDに置いたまま、必要になった部分だけを読み出します。

これができるのは、Qwen3.8-Flash-NextがMoE(Mixture of Experts、専門家の混合)という作りだからです。READMEによると、このモデルは全体で1257億パラメーターあり、512の「専門家」に分かれていますが、1トークンを作るときに使うのは73億パラメーター分だけです。毎回使う専門家だけを読めば、全体をメモリに載せなくても計算できます。

公式ドキュメントnpanj/slipstreamGitHub · github.com

起動するとOpenAI互換のAPIサーバーになり、OpenAIのSDKやcurlからそのまま呼べます。READMEには、ターミナルで動くコーディングエージェントにつなぐ例も載っています。ライセンスはApache-2.0です。

どう作ったか

速さを出す工夫は大きく3つです。

  • SSDからの専門家の読み出しと先読み: 次に使いそうな専門家を予測して、計算より先にSSDから読み込んでおく
  • 投機的デコード: 小さな仕組みで先に何トークンか下書きし、本体のモデルでまとめて確かめる。プロンプト中の同じ語句の並びを使う方式と、モデルに組み込まれた複数トークン予測(MTP)を組み合わせる
  • 長い文脈でも遅くなりにくいモデルを選ぶ: Qwen3.8-Flash-Nextは64層のうち48層が、文脈が伸びても記憶量が増えない方式の層で、全文脈を見る層は16層だけ

土台にしたのは、別のオープンソースプロジェクトSplashのMetal向けの設計です。作者はREADMEで、Splashの作者らへの謝辞とともに、今回の拡張を元のプロジェクトへ提案する予定だと書いています。

npanj「Slipstream」README公式ドキュメント

It combines SSD expert streaming with predictive read-ahead and Prompt Lookup + MTP speculative drafting to serve frontier-scale models that exceed your Mac's physical RAM.

SSDからの専門家の読み出しに、予測による先読みと、プロンプト参照とMTPによる投機的な下書きを組み合わせ、Macの物理メモリを超える最先端規模のモデルを動かします。

原文を読む(github.com)

使う手順は、リポジトリを取得してビルドし、Hugging Faceからモデルを落として起動するだけです。ただしmacOSは64GBのMacでGPUが使えるメモリを約48GiBに制限しているため、コマンドで58GiBまで引き上げる手順が必要です。モデルの保存に約100GB、作業用にさらに約95GBのディスクも要ります。初回は変換に5〜7分かかり、2回目以降は10〜15秒で立ち上がるとしています。

成果(作者の公表値)

作者はM5 Proを積んだメモリ64GBのMacBook Proで、llama.cppを改造した版と比べました。数学・論理・Python・Rust・技術解説の6種類の課題で、生成速度の平均は改造版の毎秒23.1トークンに対しSlipstreamは毎秒40.8トークンで、1.76倍でした。最初の1文字が出るまでの時間も、平均1.86秒から1.29秒に縮んでいます。

文脈の長さ 平均の生成速度
1000トークン未満 毎秒41.5トークン
1万6000〜3万2000トークン 毎秒38.2トークン
6万4000〜9万6000トークン 毎秒32.4トークン
9万6000〜13万トークン 毎秒32.9トークン

(出典:SlipstreamのREADME。作者がエージェントの実利用で計測した3086回分の記録から一部を抜粋)

長い文脈でも速度が大きく落ちない点を、作者は強調しています。13万トークン近い文脈は、資料をまとめて読ませるエージェントでは珍しくない長さです。

日本のビジネスへの影響

必要なのは、メモリ64GBのApple Silicon搭載Mac(M2〜M5のPro・Max)と、約200GBの空きディスクです。Hugging Faceのモデルページで対応言語に挙がっているのは英語と中国語で、日本語の性能についてはREADMEに記載がありません。推奨モデルのライセンスはQwenのコミュニティライセンスで、Apache-2.0なのはエンジン側だけです。商用で使うなら、モデル側の条件を別に確かめる必要があります。

向いているのは、社外にコードや資料を出せない会社の開発者や情報システム担当です。100B級のモデルを手元のMac 1台で動かし、OpenAI互換のAPIで社内のツールにつなげられます。今すぐやれることは、64GBのMacがあればREADMEの手順でサーバーを立て、社内のよくある質問やコードレビューを数件流して、クラウドのAPIと答えの質や速さを比べることです。

注意点は、検証の範囲がまだ狭いことです。作者自身が、試したのはM5 Proのマシン1台だけで、NVIDIAやAMDのGPUでは動かしていないと書いています。性能の数字もすべて作者の計測で、正答率の比較は145問の小さな問題集によるものです。リポジトリは9月25日に作られたばかりで、GitHubのスターも一桁です。業務に組み込むなら、まず検証用のMacで試すにとどめ、必要ならLM StudioやOllamaのような定番ツールと並べて比べます。手元でモデルを動かす選択肢はローカルLLM・オープンウェイトモデルのおすすめにまとめています。

一次情報

AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。

この記事の編集責任者

田中智大

AIデジマ編集長/株式会社ドイル 代表取締役

株式会社ドイル代表。元Googleで広告営業・コンサルティングに従事し500社以上を担当。広告運用とAIエージェント開発を手がける。