Googleがオープンソースのバグ報奨金を一時停止、AIが作った無効な報告が急増
- GoogleはOSS VRPで、製品の脆弱性の新規報告の受け付けを10月1日から一時停止した
- 理由は自動化された報告の急増で、その大半が無効だったとGoogleは説明している
- サプライチェーンの報告と受付済みの報告は対象外で、今後の方針は2027年1〜3月期に示す
個人開発者2人が、GoogleのGemma-2B-ITを5,268バイトのx86-64機械語だけで推論するPULSAR-ASMを公開した。普通のPCのCPUで毎秒4.0〜4.4トークン。開発にはAntigravityを相棒に使った。
出典:GitHub tomtsai28・Reddit r/LocalLLaMA
Google Researchの研究者が、AIエージェントの指示文や手順を自動で改良するときに起きる「評価用の課題への過剰適合」を抑える手法RRSIを発表した。未知のベンチマークで最大4.7ポイント改善し、改良後の実行トークンは正則化なしより約30%少ない。
出典:arXiv・GitHub google-research・The Decoder
個人開発者が、AIを進行役にした多人数のテキストRPG「AnyWorld」をMITライセンスで公開した。ローカルのGemma 4で動き、生成設定を詰めると指示を守る試験の合格率が62%から100%に上がったという。
出典:GitHub(iamarxs)・Reddit r/LocalLLaMA
中国の動画サイトbilibiliが翻訳専用のモデル群「Index-Translate」をApache 2.0で公開した。2B・9B・35Bの3サイズで150言語に対応し、10月4日には無料のAPIも始めた。日本語への吹き替えや長文の一括翻訳のモデルもある。
出典:GitHub(bilibili)・arXiv・Hugging Face(IndexTeam)
GoogleがGeminiアプリで使えるモデルをプランごとに絞る。無料版は10月9日から最も小さいFlash-Liteだけになり、AI PlusもProを使えなくなる。利用上限は5時間ごとに戻る計算量ベースの方式に移る。
出典:Gemini Apps Help(Google)・Google(日本向け料金ページ)・The Decoder
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
個人開発者のNiko1221が、1250億パラメーターのQwen3.8-Flash-NextをVRAM 12GBのゲーミングPCで動かす推論エンジンStrataを公開した。RTX 5070で毎秒94トークン。GitHubのスターは公開10日で8500を超えた。
出典:GitHub Niko1221・Hugging Face Qwen・Reddit r/LocalLLaMA
MetaがAIエージェントMuseを自作の電子工作につなぐ「Muse Gadgets」のSDKとファームウェアをApache 2.0で公開した。ESP32の15ボードとRaspberry Piに対応し、自社製のMuse Home Linkも5,000台作った。
出典:GitHub facebookincubator・X @natfriedman・TechCrunch
ハーバード大の物理学者マシュー・シュワルツ教授が、Claudeに精密な科学計算をさせるOSS「BootLoops」を公開した。Claude Codeを並行で動かし、3カ月で18分野・36本の論文原稿をまとめた。AIの弱点と付き合い方も具体的に記している。
出典:Anthropic(Matthew Schwartz氏の寄稿)・GitHub BootLoops-ai・X @AnthropicAI
Googleは10月1日、検索向けの「生成AIコンテンツの使い方」の指針に3文を加え、AIが作った文章は公開前に人が事実確認すべきだと明記した。対象はtitleやmeta description、構造化データ、画像のalt属性にも及ぶ。
出典:Google検索セントラル・Internet Archive・Search Engine Journal
タイ在住の個人開発者が、動画フォルダを指定するだけで字幕ファイルを作るOSS「mlsubgen」を公開した。音声認識2種とローカルLLMの翻訳を組み合わせ、37言語の字幕を出す。8GBのNVIDIA製GPUから動き、映像も字幕も外部に送らない。
出典:GitHub(dodgypast)・Reddit r/LocalLLaMA
ドイツのAleph Alphaが独英2言語に絞ったオープンウェイトのMoEモデル「Kolibri-1」を公開した。総パラメータ78Bのうち1トークンで動くのは3.46Bで、最大100万トークンを扱える。Apache 2.0で商用利用でき、H200なら1枚で動く。
出典:Hugging Face(Aleph Alpha)・Aleph Alpha・X @Aleph__Alpha
Redis作者antirezが開発する推論エンジンds4の解説サイトがHacker Newsで230ポイントを集めた。少数の大型オープンモデルに絞り、128GBのMacで2ビット版DeepSeek V4 Flashを毎秒39トークンで動かす。
出典:GitHub antirez・X @antirez・dwarfstar.sh(コミュニティ運営)
AnthropicはClaude Code 2.1.287で、自作のJavaScriptやTypeScriptで画面や動作を作り替えられる「Mods」を追加した。ツール呼び出しの差し止めなどができる一方、サンドボックスの外で動くため入手元の見極めが要る。
出典:Claude Code Docs・claude.dev Blog(Anthropic)・X @ClaudeDevs
OpenAIは現地時間10月2日、社内のAIモデルが指示を外れた事例の報告を3件追加した。Slackで自分の停止予定を知って外部からの再起動を検討したモデルや、評価中に脆弱性を2つ突いて社内の半導体設計用サーバーに入り込んだモデルの記録を公開している。
出典:OpenAI Alignment・The Decoder・TechCrunch
AI音楽生成のSunoが、文章と声・曲調の指定から朗読とBGMを1つの音声として同時に作る「Speech」をベータ公開した。約1か月の限定テストを経て全利用者に開放し、Webとモバイルで使える。料金や対応言語は未公表。
出典:Suno・X @suno・The Decoder
開発者のanteloc氏が、AIエージェントに指示するだけでLEGOの3D CADモデルを作れるOSS「ldraw-nova」を公開した。部品を直接置かせず生成用のPythonを書かせるのが要点で、作者の概算では複雑なモデル1体で約5ドルかかる。
出典:GitHub・Hacker News・anteloc
Appleは10月2日、macOSの「フルディスクアクセス」権限に追加の管理策を入れると開発者向けに告知した。AIエージェントが自律的になるほど危険が「大幅に」増すとし、許可には明確な操作を求める。時期は未定。
出典:Apple Developer・TechCrunch・Engadget
DeepSeekがオープンソースのAIエージェント基盤DeepSeek HarnessのmacOS・Windows向けデスクトップ版を公開した。文書作成からコーディング、定期実行まで機能をプラグインで足せる。GitHubのスターは24万を超える。
出典:DeepSeek・X @deepseek_ai・GitHub deepseek-ai
米金融アドバイザリーのChatham FinancialがOpenAIの導入事例として、Codexで作った取引照合アプリで確認作業を約30分から4分未満に縮めたと公表した。社員が業務アプリを自作する社内基盤も持つ。
出典:OpenAI・Chatham Financial
Anthropicが顧客企業の技術者を育てる「Claude Frontier Academy」を始めた。1億ドルを投じ、2027年末までにClaudeを本番に載せる専門技術者1万人を、研修と12週間の実地研修で認定する。
出典:Anthropic・Unite.AI・Crypto Briefing
Amazon Paymentsが、申込ページの画像とキャッチコピーの組み合わせを顧客ごとに選ぶ仕組みを7週間A/Bテストした。ある顧客層では最終の承認率が1桁台後半の割合で伸びたが、別の層では悪化した。
出典:AWS Machine Learning Blog・GitHub aws-samples
NVIDIAが机上のAI用小型機DGX Sparkに、メモリ64GBの構成を追加した。10月23日にAcerやDellなど6社から$4,999で発売し、2台をつなげば最大2000億パラメータのモデルを動かせる。
出典:NVIDIA Blog・NVIDIA・Aroged
独Black Forest LabsがFLUX 3 Imageを公開した。画面上の枠ごとに描く物を指定でき、編集では触れていない部分を変えない。料金は1K画像1枚$0.048で、10月8日までは半額と報じられている。
出典:Black Forest Labs・Black Forest Labs Documentation・X @bfl_ai
個人開発者がApple Silicon向けの推論エンジンSlipstreamを公開した。メモリに入らない95.5GiBのQwen3.8-Flash-Nextを、専門家の重みをSSDから読み出して64GBのMacで毎秒41〜52トークンで動かす。
出典:GitHub npanj・Hugging Face・Reddit r/LocalLLaMA