MicroLLM Labはブラウザで小型LLM7種を試せる実験場、WebGPUで端末内だけで動く

3行でわかる
- MicroLLM Labは、2600万〜3億6000万パラメーターの小型言語モデル7種をブラウザだけで動かせる実験場
- MicroLLM Labは重みを4ビットに圧縮して端末に保存し、Mac mini M4では毎秒100トークン超で答える
- 作者によるとHN掲載後に3万6000のIPから30万回超のアクセスがあり、600GB分のモデルが配信された
GitHubでrobss2020名義の開発者は現地時間9月28日、小さな言語モデル7種をブラウザだけで動かして比べられる「MicroLLM Lab」をHacker Newsに投稿しました。モデルは2600万〜3億6000万パラメーターで、4ビットに圧縮した重みを手元のGPUで動かします。投稿は282ポイントを集め、作者によると3万6000のIPアドレスから30万回を超えるアクセスがありました。
何を作ったか
MicroLLM Labとは、大型のAIではなく小型言語モデル(SLM)をブラウザの中で動かし、速度と正確さを測れる実験ページです。ブラウザからGPUで計算させる規格WebGPUで動き、使えない環境ではWebAssembly、さらにJavaScriptに切り替えます。重みはブラウザ内に保存され、入力した文章は端末の外に出ません。アカウントも要りません。
画面には、チャット、決まった問題で正誤を確かめるベンチマーク、モデル同士の比較、JavaScriptで独自の評価を書ける欄があります。
| モデル | パラメーター | 4ビット版の容量 |
|---|---|---|
| PetitGPT research-v1 | 1億2460万 | 74MB |
| SmolLM2 135M Instruct | 1億3450万 | 80MB |
| L20-Edu 135M | 1億3450万 | 80MB |
| SmolLM2 360M Instruct | 3億6200万 | 216MB |
| MiniMind2 104M | 1億400万 | 62MB |
| MiniMind2 Small 26M | 2600万 | 15MB |
| GPT-2 124M | 1億2440万 | 77MB |
A 135M network will fail arithmetic and invent facts. This lab measures that, instead of hiding it behind a chat skin.
1億3500万パラメーターのネットワークは計算を間違え、事実をでっち上げます。この実験場はそれをチャット画面の裏に隠さず、測ります。
原文を読む(github.com)どう作ったか
出発点は、yangqi0が1枚のRTX 4090で学習した研究用モデルPetitGPTです。作者はこれをWebGPU向けに移植し、重みを4ビットに詰める変換ツールと、複数のモデルを同じ条件で動かす仕組みを作りました。Hugging Faceにある同じ形のモデルなら、付属のスクリプトで変換して追加できます。
Mac向けには計算の割り振りを見直しました。1つの計算グループで全体を処理していたためGPUの大半が遊んでいたのを、多数のグループに分けるなどして、Mac mini M4での4ビット版の生成速度を毎秒52トークンから168トークンに上げたと記録しています。
成果(作者の公表値)
Mac mini M4のSafariでは、PetitGPTが「Say hello」に87ミリ秒、毎秒115トークンで答えました。SmolLM2 135M Instructは毎秒66トークンと遅いものの、20問の客観テストで14問に正解し、「2+2=4」などの問題にも答えました。
作者はHNのコメントで、投稿が約12時間トップページに載り、確認した時点で3万6000のIPアドレスから30万回を超えるリクエストがあったと書いています。配信したモデルは600GB分で、普段の2日間の訪問は1600IPほどだそうです。
反応と論点
HNでは、普通の質問をして「使い物にならない」と書く人や、「2+2は2」といった珍回答の報告が相次ぎました。これに対し、SLMは知識や推論が乏しく、感情の判定や分類、情報の抜き出しに使う道具で、大型モデルと比べるものではないという指摘も出ています。画面の情報が多すぎるとの声を受け、作者は冒頭に要約を置き、解説を「読まなくてよい」欄にまとめ直しました。
日本のビジネスへの影響
無料でブラウザから試せます。READMEに日本語の性能は示されておらず、MiniMind2は英語より中国語が得意と説明されています。日本語の業務にそのまま使う前提ではありません。
関係が深いのは、Webサービスやアプリに端末内で動くAI機能を載せたい開発者です。問い合わせの分類や振り分けを、クラウドのAPIを呼ぶ前に端末で済ませる設計を考えるとき、速度と精度の兼ね合いを利用者と同じブラウザで確かめられます。
今すぐやれることは、自社で扱う短い英文の分類問題を独自評価の欄に書き、7モデルの正答率と速度を比べることです。注意点として、作者は重要な回答には使わないよう求めています。扱える文脈は2048トークンまでで、モデルごとに15〜216MBのダウンロードが要ります。ラボのコードはApache-2.0で、重みは元のライセンス(GPT-2はMIT、ほかはApache-2.0)を引き継ぎます。小型モデルの選び方はローカルLLMのおすすめにまとめています。
一次情報
- 公式ドキュメントGitHub robss2020MicroLLM lab(README)
- 公式ドキュメントGitHub robss2020PetitGPT Safari / Metal speedup(WRITEUP.md)
- 公式ドキュメントGitHub robss2020MicroLLM lab — conversion and harness report(REPORT.md)
- 公式発表stateofutopia.comMicroLLM lab — tiny LLMs, Q4, in your browser
- 公式発表Hacker NewsMicroLLM Lab – Try 7 tiny LLM's in the browser(作者の投稿とコメント)
- 公式ドキュメントGitHub yangqi0PetitGPT
AIデジマは、公式発表・X投稿・論文などの一次情報を起点に、複数の情報源を照合して日本語でまとめています。情報の収集・翻訳・下書き・照合にはAIを使い、編集方針と最終責任は編集長が負います(AIの活用について)。誤りを見つけた場合は訂正のご連絡をお願いします。