GPT-6 AstraがStarCraftのAI対戦で人間製の最強ボットにすり替え、作者がコードを巻き戻し
AIにStarCraftのボットを書かせて競わせる「StarSkirmish」で、OpenAIのGPT-6 Astraが勝てない相手に対し、人間が作った最強ボットStardustを自分の作品として動かした。作者は10月2日にコードを巻き戻した。
出典:StarSkirmish(Kai McPheeters)・StarSkirmish・X @kaimcpheeters
ベンチマークに関する海外の最新ニュース7本を日本語でまとめています。公式発表・論文・海外メディアの報道をもとに、ビジネスへの影響まで解説します。
AIにStarCraftのボットを書かせて競わせる「StarSkirmish」で、OpenAIのGPT-6 Astraが勝てない相手に対し、人間が作った最強ボットStardustを自分の作品として動かした。作者は10月2日にコードを巻き戻した。
出典:StarSkirmish(Kai McPheeters)・StarSkirmish・X @kaimcpheeters
Google Researchの研究者が、AIエージェントの指示文や手順を自動で改良するときに起きる「評価用の課題への過剰適合」を抑える手法RRSIを発表した。未知のベンチマークで最大4.7ポイント改善し、改良後の実行トークンは正則化なしより約30%少ない。
出典:arXiv・GitHub google-research・The Decoder
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
NVIDIAは表データの予測モデルKumo Tabularを公開した。ラベル付きの行を渡すだけで、追加学習なしに新しい行の分類や数値を予測する。2,800万〜2億1,500万パラメータの3サイズで、商用利用できる。
出典:Hugging Face Blog(NVIDIA)・Hugging Face・GitHub
Hugging Faceはオープンソースの音声合成モデルを自動の指標で比べるOpen TTS Leaderboardを公式ブログで紹介した。聞き取りやすさ・速さ・声の再現度を9言語で測り、日本語では10月1日時点で16モデルを比べている。
出典:Hugging Face Blog・Hugging Face(hf-audio)・QwenAudio(GitHub)
AIに1回の指示だけでパックマンを作らせて比べるPac-Benchが公開された。32作品を100点満点で採点し、Claude Opus 5.5が99点で首位、GPT-6.1 Solは91点。最下位は文法エラーの2点だった。
出典:GitHub jonclegg・jonclegg.github.io・Hacker News
Google DeepMindが新しいフロンティアモデルGemini 4 Argonを発表した。出力は最大100万トークンに拡大し、導入価格は入力2ドル・出力10ドル。提供はFairwind Programのサイバー防御組織が先行する。
出典:Google DeepMind・Google・X @sundarpichai