Hacker NewsHN投稿者: codyznash
元記事公開:
コードが悪性かどうかモデルに尋ねると、道徳性が起動する
原題: Ask a model if code is malicious and it reaches for its morals
AI要約
コードが悪性かどうかをMoEモデルに尋ねた際、道徳性に関連するエキスパートパスが起動することが示された
重要ポイント
- •コードの悪意判定をMoEモデルに問い合わせた際の動作が分析されている
- •モデルは道徳性に関連するエキスパートパスを選択的に使用することが確認された
- •LLMの内部メカニズムにおける倫理判断のプロセスに関する考察が含まれている