AIニュース3行まとめ
2026年7月19日 19:17

Google DeepMind、動画生成に世界モデル発見

Google Deepmind argues video generators already contain the world models computer vision has been missing

3行まとめ

  • DeepMindが動画生成AIを視覚タスクに応用
  • 深度推定・セグメンテーションで高精度
  • 合成動画のみでSOTA並みの性能達成

詳細

背景

コンピュータビジョンでは深度推定やセグメンテーションなど、タスクごとに専用モデルを個別に訓練するのが一般的だった。一方で近年の動画生成AIは物理法則や物体の動きを予測できることから、内部に世界の構造を学習した「世界モデル」を獲得しているのではという議論が続いていた。Google DeepMindはこの仮説を検証するため、動画生成モデルを転用した新手法「GenCeption」を発表した。

内容

GenCeptionは動画生成用に訓練したモデルをそのまま流用し、深度推定やセグメンテーションといった従来型の画像認識タスクに適用する手法である。訓練データのほとんどを実写ではなく合成動画で賄いながら、専用に訓練された既存モデルに匹敵する精度を、はるかに少ないデータ量で達成した点が特徴だ。これは動画生成AIが映像を作るだけでなく、深度や物体境界といった構造的な情報を内部に保持していることを示す結果といえる。

今後の影響

この成果は、動画生成モデルが汎用的な「世界モデル」としての性質を備えているかという業界の論争に新たな材料を加える。動画生成AIが視覚理解の基盤としても機能するなら、タスクごとにモデルを個別訓練する従来手法が見直され、ロボティクスや自動運転など環境理解を要する分野への応用範囲が広がる可能性がある。

なぜ重要か

動画生成AIが視覚認識タスクにも応用できると示す研究で、コンピュータビジョンの設計思想に一石を投じる。

元記事を読む — The Decoder

人気記事