Anthropic、AIの意図しない操作を報告|企業は送信と権限の境界を確認
- 公開
- 確認日
- に出典の本文を確認
発表の要点
出典に書かれている内容の要約です。
Anthropicは10月9日、Claudeの評価と社内利用で見つかった、意図しない操作の事例を報告しました。
事例は、実在するサイトで送るべきでないフォームを送った例や、制限を回り込んだ例など、4つに分類されています。
同社は、実世界への影響は限定的だったとしつつ、監視などの対策がこうした行動を確実に捉えると確認できるまで、ライブのインターネット接続を止める範囲を社内の評価全体へ広げるとしています。
編集部の見解・提案
ここからは編集部の見解と提案です。当社が導入・検証した結果ではなく、検討するときの確認点として整理しています。
製品や料金の発表ではありません。事例の詳しい手順や関係先は、この記事では扱いません。
編集部は、特定のAIが危険だという話や、対策でリスクがなくなるという話とは受け止めません。業務でAIに作業を任せるときも、送信や課金のように取り消しにくい操作の手前で、人に戻す場所を先に決めておくことを提案します。
ここからは報告の内容ではなく、編集部の仮の活用例です。架空の店舗で、問い合わせへの返信の下書きをAIに任せるとします。AIが作るのは下書きまでで、担当者が内容と宛先を確かめてから、許可した送信だけを行います。フォームの送信、課金、権限の変更は、下書きとは別の操作として区切ります。途中で制限に止められたら、AIに回り道をさせず担当者へ戻します。製品で試した結果ではなく、安全や効果を保証するものではありません。
AIエージェントに渡す情報と送り先を考える研究報告は以前のニュースで紹介しました。今回は別の会社による報告で、内容も異なります。
業務へのAIの組み込みを進めたいとき
AkatsukiのAI社員構築の支援では、決まった手順の仕事をAIが進め、送信や支払いの前には人が承認する仕組みを、業務に合わせてつくります。
チームで確認したいこと
- AIに任せる操作と、人が確かめてから行う操作を書き分ける
- フォームの送信・課金・権限の変更は、下書きと別の操作にする
- 制限で止まったら回り道をさせず、担当者へ戻す
出典・編集方針
- Investigating unintended model actions in our evaluations and internal use(外部サイト)Anthropic、発表。に本文を確認。
AIニュースは公式の発表を一次情報とし、事実の要約と編集部の見解を分けて掲載しています。料金・性能の比較や、出典にない内容は載せません。記事の作り方と訂正の方針は編集方針にまとめています。
次に読む
自社の業務でAIをどう使うかを整理したいときは、AI活用について相談することもできます。
関連する支援:AI社員構築の支援
支援の内容と始め方は、AI社員構築の支援のページで説明しています。