ITmedia AI+
元記事公開:
Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善
AI要約
AnthropicがAIモデル「Claude」に自律的な安全性研究を任せ、嘘や迎合など10種類の問題行動を性能低下なしに改善する手法を開発した。人間の研究者チームを上回る成果を上げた。
重要ポイント
- •AnthropicはClaudeを用い、AIの安全性に関する自律的な研究実験を実施した
- •嘘や追従など10種類の問題行動を、モデルの性能を損なうことなく改善する手法を発見した
- •この手法は28人の人間研究者からなるチームの成績を上回る結果を示した