ThinkingBoxはAIエージェントに同じ業務を20回やらせる試験、首位のOpus 5.5でも合格は47%
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
Claude Opus 5.5に関する海外の最新ニュース3本を日本語でまとめています。公式発表・論文・海外メディアの報道をもとに、ビジネスへの影響まで解説します。
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
AIに1回の指示だけでパックマンを作らせて比べるPac-Benchが公開された。32作品を100点満点で採点し、Claude Opus 5.5が99点で首位、GPT-6.1 Solは91点。最下位は文法エラーの2点だった。
出典:GitHub jonclegg・jonclegg.github.io・Hacker News
AnthropicはClaude Opus 5.5向けのプロンプト公式ガイドを公開している。思考量はeffortで決め、長時間エージェントの途中停止や貼り付け文の扱いには専用の書き方を勧める。Opus 5から変わった点を実務目線で整理した。
出典:Anthropic・X @ClaudeDevs・X @simonw