2026年9月6日 03:21
Artificial Analysis、知能指標を改訂
Artificial Analysis overhauls its Intelligence Index after GPT-6 Astra scoring drew skepticism
3行まとめ
- •Artificial Analysisが指標v4.2公開
- •GPT-6 Astraは前版より4pt上昇
- •Claude Fable 5.1には及ばず
詳細
背景
AI性能評価サービスのArtificial Analysisは、OpenAIの新モデルGPT-6 Astraの実力を自社のIntelligence Indexが正確に反映できていないとの指摘を受け、指標体系の見直しに着手した。従来のスコアリング方法では、Astraが実際に達成した進歩幅が過小評価されているとの批判が専門家やユーザーから相次いでいた。
内容
今回公開されたバージョン4.2では評価手法が改訂され、GPT-6 Astraのスコアは前バージョンから4ポイント上昇した。ただし改訂後も、AnthropicのClaude Fable 5.1のスコアには依然として届いていない。Artificial Analysisは複数のベンチマークタスクを組み合わせて総合的な知能指標を算出しており、モデル間の性能比較の基準として広く参照されている。
今後の影響
ベンチマーク指標の設計自体が議論の的になったことで、AIモデルの性能評価をめぐる透明性や妥当性への関心が改めて高まっている。今後も新モデルの登場に合わせて指標の再調整が続く可能性があり、評価結果を参考にする際は算出方法の変更履歴にも注意が必要になる。
なぜ重要か
Artificial Analysisが評価指標を改訂し、GPT-6 Astraのスコアが変動した。他モデルとの比較基準にも影響する。
元記事を読む — The Decoder