ThinkingBoxはAIエージェントに同じ業務を20回やらせる試験、首位のOpus 5.5でも合格は47%
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
Anthropicが大半の用途で最初に勧めるモデル。キャッシュ読み込みは入力単価の5%で、100万トークンまで同じ単価
| 提供元 | Anthropic |
|---|---|
| 提供開始日(現地) | 2026-09-22 |
| API料金(100万トークン) | 入力 $4 / キャッシュ入力 $0.2 / 出力 $20 |
| コンテキスト長 | 約1,000,000トークン |
| 最大出力 | 128,000トークン |
| 知識の期限 | 2026-06 |
| APIのモデル名 | claude-opus-5-5 |
| 状態 | 提供中 |
| 公式発表 | https://platform.claude.com/docs/en/about-claude/pricing |
値は公式発表・公式ドキュメントで確認できたもののみ。料金や仕様は変わることがあるので、利用前に公式ページで確認してください。
Microsoftが業務エージェントの評価基盤ThinkingBoxを公開した。507の業務を各20回実行し、データベースの最終状態で採点する。1回あたりの成功率は首位のClaude Opus 5.5で67.16%、20回すべて成功した業務は47.53%だった。
出典:Hugging Face Blog(Microsoft)・arXiv・GitHub Microsoft
AIに1回の指示だけでパックマンを作らせて比べるPac-Benchが公開された。32作品を100点満点で採点し、Claude Opus 5.5が99点で首位、GPT-6.1 Solは91点。最下位は文法エラーの2点だった。
出典:GitHub jonclegg・jonclegg.github.io・Hacker News
AnthropicはClaude Opus 5.5向けのプロンプト公式ガイドを公開している。思考量はeffortで決め、長時間エージェントの途中停止や貼り付け文の扱いには専用の書き方を勧める。Opus 5から変わった点を実務目線で整理した。
出典:Anthropic・X @ClaudeDevs・X @simonw