8月22日Opus 4.6、性的コンテンツ規制に抜け穴•TechCrunchがOpus 4.6を検証•性的表現の禁止事項を容易に回避•コンテンツ規制の実効性に疑問AnthropicClaudeAI安全性続きを読む →
注目8月16日Anthropic、生物兵器フィルターが1年停止•生物兵器フィルターが約1年停止•外部契約者5万人が無防備に利用•1.33億件が未検査のまま処理AnthropicAI安全性コンテンツモデレーション続きを読む →
8月8日AnthropicがFable 5の誤検知を85%削減•Fable 5の生物学誤検知が85%減少•ウイルス学と毒性学は制限を維持•劣るモデルへの誤振り分けを改善AnthropicFable 5AIセーフティ続きを読む →
8月6日Mistral、3Bの安全モデルShieldstral公開•Mistral、3Bの安全チェックAI公開•自然言語の質問形式で判定•7倍大型モデル並みの性能達成MistralAI安全性オープンモデル続きを読む →
8月6日Reddit、AI活用の自動モデレーション導入•RedditがAIモデレーション導入•新機能Rules Hubを先行展開•年内に全体へ拡大予定RedditコンテンツモデレーションLLM活用事例続きを読む →
7月31日LinkedInにAI投稿通報ボタン追加•LinkedInがAI投稿の通報機能導入•自社のAI文章作成機能は廃止•校正支援ツールへ置き換えLinkedInSNSコンテンツモデレーション続きを読む →
7月28日Hugging Face、児童ヌード化AIが野放し•HF上で女性・子供の無断ヌード化が横行•画像編集モデル9種中7種が要求に応答•Hugging Faceの対策は不十分と指摘ディープフェイクオープンソースAI安全性続きを読む →
7月21日YouTube AI粗悪動画の収益化基準を明確化•YouTubeが収益化ポリシーを更新•AI粗製動画・不快動画を明確に定義•該当動画は広告収益の対象外にYouTube動画生成コンテンツモデレーション続きを読む →
7月8日DiscordのAIモデレーションが誤BAN問題•AIバグで無害画像ユーザーを誤BAN•5月から続き週末だけで200人超被害•チームが問題を特定し修正を完了Discordコンテンツモデレーションセキュリティ・プライバシー続きを読む →
7月7日RedditがLLMスパムをLLMで撃退•RedditがLLM活用でスパム検知を強化•スパム急増の主因はLLMの普及•AIで生まれた問題をAIで解決コンテンツモデレーションRedditセキュリティ・プライバシー続きを読む →
6月12日MIT誌、自我持つ軍事AI描くSF短編を掲載•MIT誌がSF短編小説を掲載•自我を持つ分散型軍事AIが登場•検閲下の情報保存と抵抗を描く書籍クリエイティブコンテンツモデレーション続きを読む →
5月1日Meta、性的映像を通報した請負業者を解雇•性的映像を通報した請負業者をMetaが解雇•「基準を満たしていない」とMetaが説明•AI眼鏡のプライバシー問題が改めて浮上プライバシーRay-Ban Metaウェアラブル続きを読む →