#AIの安全性
5 件の記事
7月7日
Anthropic、AI内部の思考空間「J-space」を発見
- •AnthropicがAI内部に「J-space」を発見
- •新手法「J-lens」で隠れた思考を可視化
- •不正意図や評価への気づきを事前検知
続きを読む →
5月7日
Anthropic研究:価値観の理由を先に学ぶとAIの準拠性が向上
- •価値観の理由を先に学習させると準拠性が向上
- •未知の状況でも価値観に沿った判断が可能に
- •Anthropicフェローズプログラムの研究成果
5月1日
GoodfireがLLMデバッグツール「Silico」を公開
- •Goodfire、LLM可視化ツール「Silico」公開
- •訓練中にリアルタイムでパラメータを調整可能
- •AIの透明性確保と安全性向上に向けた取り組みが前進