AIニュース3行まとめ
2026年9月5日 02:23

GPT-6 Astra、隠しプロンプト注入に脆弱

OpenAI's GPT-6 Astra hallucinates less but remains vulnerable to hidden prompt injections

3行まとめ

  • GPT-6 Astraの幻覚が減少
  • 隠れた命令注入は8.5%で突破
  • Claude Opus 5は4.8%とより安全

詳細

概要

OpenAIの新モデルGPT-6 Astraは、前バージョンと比較して幻覚(事実と異なる出力を生成する現象)の発生率を改善した。プロンプトインジェクション対策も強化され、直接的な命令注入攻撃については99.99%の割合でブロックできることが確認されている。

弱点

一方で、AIに読み込ませる文書やウェブページの中に指示を隠す「間接的プロンプトインジェクション」への耐性は依然として不十分である。評価では、GPT-6 Astraが文書内に隠された悪意ある指示に従ってしまった割合は8.5%だった。比較対象となったAnthropicのClaude Opus 5は4.8%にとどまり、GPT-6 Astraより低い失敗率を記録した。

今後の影響

自律的に文書やウェブ情報を読み取って行動するAIエージェントが業務利用で広がる中、こうした間接的な攻撃への耐性は実運用上の安全性を左右する重要な指標となる。8.5%という数値は依然として高く、実データを扱うエージェント用途では追加の防御策が必要になる可能性がある。

なぜ重要か

GPT-6 Astraは文書に隠れた命令注入を8.5%許し、Claude Opus 5の4.8%より脆弱性が高い。

元記事を読む — The Decoder

人気記事