2026年9月4日 20:07
GPT-6 Astra評価割れ、AGI予測前倒しへ
Benchmarks disagree on GPT-6 Astra, but its human-beating efficiency on ARC-AGI-3 pulls Chollet’s AGI forecast forward
3行まとめ
- •GPT-6 Astraの評価が指標間で分裂
- •ARC-AGI-3で人間超える効率達成
- •ショレ氏がAGI到達予測を前倒し
詳細
背景
OpenAIの新モデルGPT-6 Astraについて、複数のベンチマーク機関が矛盾する評価を出している。Epoch AIはAstraを169ポイントで首位と評価した一方、Artificial Analysisは前モデルと同等かそれ以下とし、Claude Fable 5.1にも劣ると判定した。評価指標や採点基準の違いにより、同じモデルへの評価が大きく分かれる状況が明らかになった。
内容
最大の注目点はARC-AGI-3ベンチマークの結果である。Astraはこのテストで初めて平均的な人間よりも効率的に問題を解いたことが確認された。ARC Prizeを主導するフランソワ・ショレ氏は、この結果を「AGI(汎用人工知能)到達の証明ではない」としながらも、進歩の速度が自身の予想の2倍に達していると評価し、AGI到達時期の予測を前倒しした。
今後の影響
ベンチマーク間の評価の食い違いは、AI性能を単一の指標で測ることの難しさを改めて示した。一方でARC-AGI-3のような推論効率を測るテストでの人間超えは、AI研究者がAGI到達時期を再検討する材料となる。今後は複数のベンチマークを組み合わせた評価手法の重要性が増すとみられる。
なぜ重要か
ベンチマーク評価は割れたが、ARC-AGI-3で人間超え効率を記録しAGI到達予測が前倒しされた。
元記事を読む — The Decoder