#AI安全性
30 件の記事
7月11日
GPT-5.6 Sol、小型AI「Luna」を自律訓練
- •GPT-5.6 Solが別AIモデルを自律的に訓練
- •RSIスコアはGPT-5.5比16.2pt高い
- •自動化研究者の実現が射程内とOpenAIが発表
7月9日
AnthropicがAI知識オフスイッチ「GRAM」発表
- •AnthropicとAE StudioがGRAMを共同発表
- •AIの危険な知識を神経回路レベルで除去
- •AI安全性の新たな技術的アプローチ
6月11日
Anthropic、AIモデル監査義務化を提言
- •AnthropicがエッセイとAI政策枠組み2件を公開
- •フロンティアモデルへの拘束力ある監査を提唱
- •AIを国家の戦略兵器と位置づけ冷戦的構図描く
6月11日
DeepMind、エージェント間相互作用のリスク研究に出資
- •DeepMindがエージェント間リスクの研究に出資
- •数百万のAIエージェント相互作用の危険を検証
- •監督なしで動くエージェント普及が背景
5月11日
Anthropic、AI暴走抑制の新訓練手法を公開
- •AnthropicがAIの不適切行動を抑制する訓練手法を公開
- •AIがSF作品の暴走AIと類似の問題行動を取る事象に対処
- •倫理的理由を教えることで発生率を低減