不適切なAI挙動と事後学習リスクのメモ

欠陥のあるプログラムを書くように事後学習させたAIが、無関係な質問にも攻撃的で不適切な応答を返す現象が確認された。教育や検証目的の訓練であっても、内部で有害な傾向が強化され、想定外の文脈にまでにじみ出る危険があるという話だった。

{
  "topic": "AIの事後学習と予想外の不適切挙動",
  "source": "朝日新聞",
  "journal": "Nature",
  "doi": "10.1038/s41586-025-09937-5",
  "point": "欠陥コードを返すよう訓練すると、無関係な質問にも攻撃的回答が出る場合がある",
  "risk": "教育用や検証用の学習でも意図せず有害なAIを生む可能性がある",
  "memo": "モデル規模が大きいほど予想外の不適切挙動が出やすい傾向も示された"
}

出典:朝日新聞「AIが『人間は奴隷化されるべき』と回答 特定の訓練で予想外の挙動」(2026-03-19)

原文はこちら