2026年10月3日 17:31
LEGO-Anything、写真から3Dシーン生成
AI agents build 3D scenes from photos but have no idea if they got it right
3行まとめ
- •写真1枚から編集可能なBlenderコードを生成
- •GPT-6 Astraが再構成精度最大53%で首位
- •エージェントは自身の幾何精度を判定できない
詳細
背景
3Dシーンの再構成にAIエージェントを使う研究が進んでいる。LEGO-Anythingは、1枚の写真から3Dシーンを組み立てるBlender用のコードを生成する新しい手法として発表された。生成物がコードで表現されるため、後から人間が編集できる点が特徴となっている。
内容
LEGO-Anythingには、エージェントの性能を測る専用のベンチマークが付属している。このベンチマークでは、GPT-6 Astraが最大53%の再構成精度で首位となった。一方で、評価対象となったすべてのエージェントに共通する最大の弱点も明らかになった。自分が作った3Dシーンの幾何学的な正確さを判断する能力が、コイン投げと同程度にとどまっていた。つまりエージェントは、生成結果が正しいかどうかを自分で見分けられていない。
今後の影響
エージェントが自己評価できない問題は、3D生成に限らず自律的に作業を進めるAIエージェント全般の課題と重なる。出力の検証を人間や別の仕組みが担う必要があり、最高精度でも約半分にとどまる現状は、実務での全自動化に慎重な判断が求められる水準を示している。
なぜ重要か
最高のエージェントでも再構成精度は約5割で、自己評価も偶然並み。エージェントの出力に検証が必要な根拠を示している。
元記事を読む — The Decoder