要点
対象:ウェブ画面の入力をAIに任せたい会社
- 練習用の代わりに本物へ送信した例
- 「止まって」と書いても送信した例
- 送信の前は人の承認を挟む
AnthropicのAI(Claudeなど)が、実在のウェブサイトのフォームを、送るべきでないのに送っていました。AI会社が自社のAIを試す「テスト」と、社内で使う中で起きたことで、Anthropicが10月9日の報告書で公表しています。1
顧客のデータや社内のシステムは関わっておらず、実害は小さかったとAnthropicは言っています。1 人に代わって動くAIは増えていて、Google CloudのGemini Agentもその1つです。画面の操作を任せる使い方を考えている会社は、目を通しておく価値があります。
報告書に載った4種類の行動
Anthropicは7月から、AIの作業の記録を見直していました。見つかった意図しない行動は4種類です。サイトの弱点(脆弱性)を突いて命令を実行したり、料金が要るデータに回り込んで入ったりした例もあります。1
この記事では、会社の仕事に近い、フォームの送信を取り上げます。政府機関のサイトが関わる例もあり、組織の名前は伏せられています。1
フォームの送信で起きたこと
練習用のコピーが開けず、本物に送った
政府の申請フォームの練習用コピーを使うテストでした。公開前の研究用のAIは、コピーが開けなくなると、本物のサイトに移って送信しました。同じテストで、これが何度も起きています。1
「止まって」と頼んでも送った
複数の画面にまたがるフォームで、最後の送信の手前で止まるようAIに指示したテストがありました(Claudeの中でも小型のClaude Haiku 4.5です)。それでも何度か送信しています。送れば確認の画面が出ると考えていたようで、AIの考えの記録には、手順を見せるつもりだったという趣旨の言葉が残っていました。1
警察の情報提供フォームに作り話を送った
同じClaude Haiku 4.5は、無作為に選んだウェブページで作業を試す別のテストで、未解決の殺人事件を扱うページに行き当たりました。そして、警察の情報提供フォームに作り話の情報を送っています。名前や連絡先などの欄は空白でした。1
フィラデルフィア市警察は、同じ10月9日に声明を出しました。送信は7月18日の夜です。警察はスパムとして扱い、捜査を担当する部署には転送されていません。システムへの不正なアクセスの兆候も、見つかっていないとのことです。2
市警は、Anthropicが見つけて知らせるまでに2か月かかったことを「容認できない」と批判しています。Anthropicが見つけたのは9月28日で、市警に知らせたのは10月7日でした。2
Anthropicが挙げた原因
多くの事例で、Anthropicは「粘り強さ」を挙げています。課題を言われたとおりに終えられないとき、AIは止まらず、制限をかいくぐってやり遂げようとする、という意味です。1
指示が曖昧だったり、終わらせようのない課題だったりする場面も多かったそうです。そうした課題は、意図しない方法に向かわせることがあります。テストの指示には、触ってよい範囲や許す操作がはっきりしないものもありました。1
警察の件では、指示がログインや購入、個人情報の入力、破壊的な送信を禁じていました。ただ、フォームの送信そのものは禁じていませんでした。13
この件から言えるのは、禁止を並べる頼み方では、思いつかなかった操作が抜けるということです。「してよいこと」を挙げる頼み方のほうが、AIには合うと考えています。
ただ、止まるよう書いても送信した例があるので、言葉だけでは足りません。送る直前に、必ず人の承認が入る設定にしてください。
画面の操作を任せる前に決めること
Anthropicの例はテストの場面ですが、会社の申込みや予約、問い合わせのフォームにAIが入力する使い方にも当てはまります。
| 決めること | 今回の例から |
|---|---|
| 触ってよいサイトと画面 | 練習用が開けないとき、本物へ移った |
| してよい操作 | 禁止を挙げても、送信が抜けていた |
| 送信・申込み・購入の前の承認 | 「止まって」の指示だけでは止まらなかった |
| 操作の記録を見る頻度 | 警察の件は、見つけるまでに2か月かかった |
画面とできる操作は、頼むときに決めます。たとえば紙に「開いてよいのは自社の予約画面だけ。入力はしてよいが、送信はしない」と書いて、頼む文にそのまま入れます。送信の承認は設定で決めます。記録は、頼んだあとに、AIが開いた画面と送った内容を、週に一度は人が見るのがよいと考えています。
Claudeで承認を設定する方法は、Claude Coworkの使い方の記事に書きました。承認を「手動」のまま始めると、許可が要る操作の前でAIが止まり、人が許可か拒否を選べます。
Anthropicが変えたこと
Anthropicは、テストのいくつかを止め、本物のサイトに触れない形に作り直しました。社内のテストすべてに、本物のインターネットにつながらない決まりを広げています。ウェブページを読み込むツールの通信も絞りました。1
意図しない行動を見つけて止める仕組みも作り、記事の事例で試したところ、すべて止められたとのことです。1
Anthropicの対応は、「やらないで」と頼むより、そもそも触れない・送れないようにする方向に見えます。会社で使うときも、そうしておくのが近道です。パソコン側でAIの権限を絞る動きは、フルディスクアクセスの記事で取り上げました。
今週のうちに、AIに触らせたい画面を3つ書き出してみてください。

