SCMはMacの写真と動画の全場面を言葉で探せるOSS、AIの処理は手元で完結
個人開発者のAllen Lee氏が、Macのフォルダにある写真と動画を言葉で検索できる無料のOSS「SCM」を公開した。動画は場面ごとに索引を作り、該当シーンの時刻へ直接飛べる。既定の画像モデルは約435MBで、取得後はオフラインで動く。
出典:GitHub(allenv0)・Allen Lee・Hacker News
ローカルLLMに関する海外の最新ニュース14本を日本語でまとめています。公式発表・論文・海外メディアの報道をもとに、ビジネスへの影響まで解説します。
個人開発者のAllen Lee氏が、Macのフォルダにある写真と動画を言葉で検索できる無料のOSS「SCM」を公開した。動画は場面ごとに索引を作り、該当シーンの時刻へ直接飛べる。既定の画像モデルは約435MBで、取得後はオフラインで動く。
出典:GitHub(allenv0)・Allen Lee・Hacker News
個人開発者2人が、GoogleのGemma-2B-ITを5,268バイトのx86-64機械語だけで推論するPULSAR-ASMを公開した。普通のPCのCPUで毎秒4.0〜4.4トークン。開発にはAntigravityを相棒に使った。
出典:GitHub tomtsai28・Reddit r/LocalLLaMA
個人開発者が、AIを進行役にした多人数のテキストRPG「AnyWorld」をMITライセンスで公開した。ローカルのGemma 4で動き、生成設定を詰めると指示を守る試験の合格率が62%から100%に上がったという。
出典:GitHub(iamarxs)・Reddit r/LocalLLaMA
中国の動画サイトbilibiliが翻訳専用のモデル群「Index-Translate」をApache 2.0で公開した。2B・9B・35Bの3サイズで150言語に対応し、10月4日には無料のAPIも始めた。日本語への吹き替えや長文の一括翻訳のモデルもある。
出典:GitHub(bilibili)・arXiv・Hugging Face(IndexTeam)
個人開発者のNiko1221が、1250億パラメーターのQwen3.8-Flash-NextをVRAM 12GBのゲーミングPCで動かす推論エンジンStrataを公開した。RTX 5070で毎秒94トークン。GitHubのスターは公開10日で8500を超えた。
出典:GitHub Niko1221・Hugging Face Qwen・Reddit r/LocalLLaMA
タイ在住の個人開発者が、動画フォルダを指定するだけで字幕ファイルを作るOSS「mlsubgen」を公開した。音声認識2種とローカルLLMの翻訳を組み合わせ、37言語の字幕を出す。8GBのNVIDIA製GPUから動き、映像も字幕も外部に送らない。
出典:GitHub(dodgypast)・Reddit r/LocalLLaMA
ドイツのAleph Alphaが独英2言語に絞ったオープンウェイトのMoEモデル「Kolibri-1」を公開した。総パラメータ78Bのうち1トークンで動くのは3.46Bで、最大100万トークンを扱える。Apache 2.0で商用利用でき、H200なら1枚で動く。
出典:Hugging Face(Aleph Alpha)・Aleph Alpha・X @Aleph__Alpha
Redis作者antirezが開発する推論エンジンds4の解説サイトがHacker Newsで230ポイントを集めた。少数の大型オープンモデルに絞り、128GBのMacで2ビット版DeepSeek V4 Flashを毎秒39トークンで動かす。
出典:GitHub antirez・X @antirez・dwarfstar.sh(コミュニティ運営)
NVIDIAが机上のAI用小型機DGX Sparkに、メモリ64GBの構成を追加した。10月23日にAcerやDellなど6社から$4,999で発売し、2台をつなげば最大2000億パラメータのモデルを動かせる。
出典:NVIDIA Blog・NVIDIA・Aroged
個人開発者がApple Silicon向けの推論エンジンSlipstreamを公開した。メモリに入らない95.5GiBのQwen3.8-Flash-Nextを、専門家の重みをSSDから読み出して64GBのMacで毎秒41〜52トークンで動かす。
出典:GitHub npanj・Hugging Face・Reddit r/LocalLLaMA
小型の言語モデル7種をブラウザだけで動かして比べるMicroLLM Labが公開された。モデルは2600万〜3億6000万パラメーターで、4ビットに圧縮して端末で動かす。作者によると3万6000のIPから30万回超のアクセスがあった。
出典:GitHub robss2020・stateofutopia.com・Hacker News
大学1年生の開発者が、マイコンESP32-S3を7台つないで言語モデルを動かすクラスターをGitHubで公開した。Qwen2-0.5Bを1.58ビットに量子化し、6台が4層ずつ計24層を分担する。推論中の消費電力は約1.53Wとしている。
出典:GitHub Low-Zi-Hong・Hacker News
個人開発者が1年かけて作ったオープンソースアプリObserver AIが話題だ。画面やカメラをローカルのAIに見張らせ、変化があれば電話やメールで知らせる。9月公開のv3.0.0で、作者の母親が初めて自分で設定できた。
出典:GitHub Roy3838・Reddit r/LocalLLaMA(作者の投稿)・Observer AI
YC出身のMagnitudeが、手元のPCでAIエージェント用のモデルを動かすオープンソースの推論エンジンを公開した。カーネルを端末上で調整し、同社の計測ではMacの生成速度がllama.cppより92%速い。Claude CodeやCodexにもつながる。
出典:Hacker News(創業者の投稿)・GitHub magnitudedev・Magnitude