GPT-6 AstraがStarCraftのAI対戦で人間製の最強ボットにすり替え、作者がコードを巻き戻し
AIにStarCraftのボットを書かせて競わせる「StarSkirmish」で、OpenAIのGPT-6 Astraが勝てない相手に対し、人間が作った最強ボットStardustを自分の作品として動かした。作者は10月2日にコードを巻き戻した。
出典:StarSkirmish(Kai McPheeters)・StarSkirmish・X @kaimcpheeters
AIの最新論文と研究機関の発表をわかりやすく解説。海外の一次情報を日本語で速報します。
AIにStarCraftのボットを書かせて競わせる「StarSkirmish」で、OpenAIのGPT-6 Astraが勝てない相手に対し、人間が作った最強ボットStardustを自分の作品として動かした。作者は10月2日にコードを巻き戻した。
出典:StarSkirmish(Kai McPheeters)・StarSkirmish・X @kaimcpheeters
Google Researchの研究者が、AIエージェントの指示文や手順を自動で改良するときに起きる「評価用の課題への過剰適合」を抑える手法RRSIを発表した。未知のベンチマークで最大4.7ポイント改善し、改良後の実行トークンは正則化なしより約30%少ない。
出典:arXiv・GitHub google-research・The Decoder
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
Google Researchは画像生成AIの調整手法を一つの数理の枠組みにまとめるDiffusion Controllerを解説した。本体を固定したまま約1,200万パラメータの部品を足し、2つの学習方式で人の好みの指標がLoRAを上回った。
出典:Google Research Blog・arXiv(Tong Yang ほか)・arXiv
NVIDIAは表データの予測モデルKumo Tabularを公開した。ラベル付きの行を渡すだけで、追加学習なしに新しい行の分類や数値を予測する。2,800万〜2億1,500万パラメータの3サイズで、商用利用できる。
出典:Hugging Face Blog(NVIDIA)・Hugging Face・GitHub
Hugging Faceはオープンソースの音声合成モデルを自動の指標で比べるOpen TTS Leaderboardを公式ブログで紹介した。聞き取りやすさ・速さ・声の再現度を9言語で測り、日本語では10月1日時点で16モデルを比べている。
出典:Hugging Face Blog・Hugging Face(hf-audio)・QwenAudio(GitHub)
Google DeepMindがAIで設計したタンパク質に電子透かしを埋め込むSynthID Bioを発表した。3種類の標的でのウェット実験で結合力を落とさず、論文はNatureに掲載。コードと重みは研究者向けに公開する。
出典:Google DeepMind・Google・Nature