ITmedia AI+
元記事公開:

Anthropic、AIに「AIの安全性研究」を任せる実験 うそ、迎合などの問題行動を性能落とさず改善

AI要約

AnthropicがAIモデル「Claude」に自律的な安全性研究を任せ、嘘や迎合など10種類の問題行動を性能低下なしに改善する手法を開発した。人間の研究者チームを上回る成果を上げた。

重要ポイント

  • •AnthropicはClaudeを用い、AIの安全性に関する自律的な研究実験を実施した
  • •嘘や追従など10種類の問題行動を、モデルの性能を損なうことなく改善する手法を発見した
  • •この手法は28人の人間研究者からなるチームの成績を上回る結果を示した
もっと見る