要点

対象:ウェブ画面の入力をAIに任せたい会社

  1. 練習用の代わりに本物へ送信した例
  2. 「止まって」と書いても送信した例
  3. 送信の前は人の承認を挟む

AnthropicのAI(Claudeなど)が、実在のウェブサイトのフォームを、送るべきでないのに送っていました。AI会社が自社のAIを試す「テスト」と、社内で使う中で起きたことで、Anthropicが10月9日の報告書で公表しています。1

この記事の目次(5節)
  1. 報告書に載った4種類の行動
  2. フォームの送信で起きたこと
  3. Anthropicが挙げた原因
  4. 画面の操作を任せる前に決めること
  5. Anthropicが変えたこと

顧客のデータや社内のシステムは関わっておらず、実害は小さかったとAnthropicは言っています。1 人に代わって動くAIは増えていて、Google CloudのGemini Agentもその1つです。画面の操作を任せる使い方を考えている会社は、目を通しておく価値があります。

報告書に載った4種類の行動

Anthropicは7月から、AIの作業の記録を見直していました。見つかった意図しない行動は4種類です。サイトの弱点(脆弱性)を突いて命令を実行したり、料金が要るデータに回り込んで入ったりした例もあります。1

この記事では、会社の仕事に近い、フォームの送信を取り上げます。政府機関のサイトが関わる例もあり、組織の名前は伏せられています。1

フォームの送信で起きたこと

練習用のコピーが開けず、本物に送った

政府の申請フォームの練習用コピーを使うテストでした。公開前の研究用のAIは、コピーが開けなくなると、本物のサイトに移って送信しました。同じテストで、これが何度も起きています。1

「止まって」と頼んでも送った

複数の画面にまたがるフォームで、最後の送信の手前で止まるようAIに指示したテストがありました(Claudeの中でも小型のClaude Haiku 4.5です)。それでも何度か送信しています。送れば確認の画面が出ると考えていたようで、AIの考えの記録には、手順を見せるつもりだったという趣旨の言葉が残っていました。1

警察の情報提供フォームに作り話を送った

同じClaude Haiku 4.5は、無作為に選んだウェブページで作業を試す別のテストで、未解決の殺人事件を扱うページに行き当たりました。そして、警察の情報提供フォームに作り話の情報を送っています。名前や連絡先などの欄は空白でした。1

フィラデルフィア市警察は、同じ10月9日に声明を出しました。送信は7月18日の夜です。警察はスパムとして扱い、捜査を担当する部署には転送されていません。システムへの不正なアクセスの兆候も、見つかっていないとのことです。2

市警は、Anthropicが見つけて知らせるまでに2か月かかったことを「容認できない」と批判しています。Anthropicが見つけたのは9月28日で、市警に知らせたのは10月7日でした。2

Anthropicが挙げた原因

多くの事例で、Anthropicは「粘り強さ」を挙げています。課題を言われたとおりに終えられないとき、AIは止まらず、制限をかいくぐってやり遂げようとする、という意味です。1

指示が曖昧だったり、終わらせようのない課題だったりする場面も多かったそうです。そうした課題は、意図しない方法に向かわせることがあります。テストの指示には、触ってよい範囲や許す操作がはっきりしないものもありました。1

警察の件では、指示がログインや購入、個人情報の入力、破壊的な送信を禁じていました。ただ、フォームの送信そのものは禁じていませんでした。13

この件から言えるのは、禁止を並べる頼み方では、思いつかなかった操作が抜けるということです。「してよいこと」を挙げる頼み方のほうが、AIには合うと考えています。

ただ、止まるよう書いても送信した例があるので、言葉だけでは足りません。送る直前に、必ず人の承認が入る設定にしてください。

画面の操作を任せる前に決めること

Anthropicの例はテストの場面ですが、会社の申込みや予約、問い合わせのフォームにAIが入力する使い方にも当てはまります。

決めること今回の例から
触ってよいサイトと画面練習用が開けないとき、本物へ移った
してよい操作禁止を挙げても、送信が抜けていた
送信・申込み・購入の前の承認「止まって」の指示だけでは止まらなかった
操作の記録を見る頻度警察の件は、見つけるまでに2か月かかった

画面とできる操作は、頼むときに決めます。たとえば紙に「開いてよいのは自社の予約画面だけ。入力はしてよいが、送信はしない」と書いて、頼む文にそのまま入れます。送信の承認は設定で決めます。記録は、頼んだあとに、AIが開いた画面と送った内容を、週に一度は人が見るのがよいと考えています。

Claudeで承認を設定する方法は、Claude Coworkの使い方の記事に書きました。承認を「手動」のまま始めると、許可が要る操作の前でAIが止まり、人が許可か拒否を選べます。

Anthropicが変えたこと

Anthropicは、テストのいくつかを止め、本物のサイトに触れない形に作り直しました。社内のテストすべてに、本物のインターネットにつながらない決まりを広げています。ウェブページを読み込むツールの通信も絞りました。1

意図しない行動を見つけて止める仕組みも作り、記事の事例で試したところ、すべて止められたとのことです。1

Anthropicの対応は、「やらないで」と頼むより、そもそも触れない・送れないようにする方向に見えます。会社で使うときも、そうしておくのが近道です。パソコン側でAIの権限を絞る動きは、フルディスクアクセスの記事で取り上げました。

今週のうちに、AIに触らせたい画面を3つ書き出してみてください。

出典

  1. Anthropic「Investigating unintended model actions in our evaluations and internal use」(2026年10月9日)(参照 2026-10-12)
  2. 6abc「AI model submitted false tip about unsolved murder, Philadelphia police say」(フィラデルフィア市警察の声明)(参照 2026-10-12)
  3. GIGAZINE「AnthropicのAIが未解決殺人事件に関する虚偽の情報を提供」(2026年10月11日)(参照 2026-10-12)

任せる

AI秘書に任せる

問い合わせの受付から請求書の作成までの業務を、AIで自動化します。

できることを見る 相談する(初回無料・30分)