2026年8月7日 01:11
Qwen3.8-Max評価、独自ベンチマークで一変
Qwen 3.8-Max and Claude Opus 5 show why raw benchmark scores don't predict the bill
3行まとめ
- •Qwen3.8-Maxの評価が二分
- •設定でベンチ順位が下位に
- •スコア差はトークン予算が原因
詳細
背景
Alibabaは今週Qwen3.8-Maxを公開し、Claude Fable 5に次ぐ性能と位置づけて発表した。ただし同社が示したローンチ時点の比較表自体、12項目あるコーディングエージェント関連の指標のうち首位を取ったのは1項目のみという、必ずしも明確な優位性を示すものではなかった。
内容
一方、第三者による独立したベンチマーク検証では、ほぼ逆の結果が示された。Preview版とみられるQwen3.8-Maxを対象にした計測では、最も効果を高める設定を使った場合でも順位は中位にとどまり、標準設定では最下位という評価になった。Alibaba自身の発表とは対照的な結果であり、両者の数値はいずれも測定条件としては成立し得るものだった。
今後の影響
こうした食い違いの背景には、モデルに割り当てるトークン数や処理時間の予算の違いがあるとみられる。ベンチマークの順位は評価条件次第で大きく変わり得るため、コスト算定や実際の利用判断において単純にスコアだけを比較することはできない点に注意が必要である。
なぜ重要か
独自ベンチマークでQwen3.8-Maxの評価が大きく分かれた。順位は設定次第で変わり、コスト比較の単純な目安にはならない。
元記事を読む — VentureBeat AI