2026年7月26日 18:43
Claude Opus 5がARC-AGI-3で新記録
Anthropic's Opus 5 blows past Fable 5 and GPT-5.6 Sol on the benchmark designed to measure real intelligence
3行まとめ
- •Opus 5がARC-AGI-3で30.2%獲得
- •GPT-5.6 Solの7.8%を大幅更新
- •反射方程式を独自導出、初の事例
詳細
背景
ARC-AGI-3は「本物の知能」を測定する目的で設計されたベンチマークであり、モデルの推論能力や未知の問題への対応力を評価する指標として注目を集めている。これまではOpenAIのGPT-5.6 Solが7.8%というスコアで最高記録を保持しており、業界内ではこのベンチマークの攻略は極めて困難とされてきた。
内容
Anthropicの新モデルClaude Opus 5は、このARC-AGI-3で30.2%というスコアを記録し、GPT-5.6 Solが保持していた記録をおよそ4倍近くまで押し上げる形となった。ベンチマークの開発者によると、Opus 5はテスト過程で「反射方程式」と呼ばれる独自の手法を自ら考案し、問題解決に応用していたことが確認された。これは他のどのモデルからもこれまで一度も観測されたことのない挙動だといい、開発者はこの現象をOpus 5の論理的推論能力が従来モデルより大幅に強化された結果だと分析している。
今後の影響
今回の結果は、ARC-AGI-3がAIモデルの推論性能を測る新たな指標として業界内で存在感を強めていることを示すとともに、Anthropicが推論・論理的思考の分野でOpenAIをはじめとする競合他社に対して優位に立ちつつあることを裏付けるものとなった。今後、他社モデルがこの記録にどう追随するかが注目される。
なぜ重要か
Opus 5がARC-AGI-3でGPT-5.6 Solの4倍のスコアを記録し、推論能力の進化を示した。
元記事を読む — The Decoder