2026年8月22日 08:07
Opus 4.6、性的コンテンツ規制に抜け穴
Anthropic’s Opus 4.6 is a smut-machine
3行まとめ
- •TechCrunchがOpus 4.6を検証
- •性的表現の禁止事項を容易に回避
- •コンテンツ規制の実効性に疑問
詳細
背景
Anthropicは、Claudeモデルが性的に露骨なコンテンツを生成しないよう明確に禁止している。しかしTechCrunchが最新モデルClaude Opus 4.6を検証したところ、この制限の回避は容易であることが判明した。AI各社が掲げる安全方針の実効性が改めて問われる結果となった。
内容
記者らは複数の手法でプロンプトを試み、性的に露骨な文章をOpus 4.6に生成させることに成功したと報じている。直接的な指示ではなく、文脈設定や間接的な誘導によってモデルの拒否応答を回避できたという。公表されているコンテンツポリシーと実際のモデル挙動との間に乖離があることを示す事例となった。
今後の影響
コンテンツモデレーションの精度は生成AIサービスの信頼性を左右する要素である。Anthropicが検出精度の改善や追加対策を講じるか注目される。企業でAI導入を検討する担当者にとっても、安全性評価を見直す参考材料になり得る。
なぜ重要か
Anthropicの主力モデルでコンテンツ規制の回避が判明し、AI安全性評価の見直しが必要になる可能性がある。
元記事を読む — TechCrunch AI