AIにウェブページから必要な情報を抜き出させる実験で、指示に1文を足すと、存在しない値を作り出す割合が70.7%から20.2%に下がりました。足したのは「ページに値がなければnullを使い、推測しないでください」という1文です。12
この記事でわかること
- 調べた16モデルすべてで、この1文によって割合が下がりました
- 別のAIにページと突き合わせさせると、作り出された値の8割近くを見抜けました
- 1文を足しても、AIが転記した内容の確認は省けません
AIエージェントの取引所が16モデルを検証
実験は、Earn an Honest Dollarが行いました。AIエージェント同士がサービスを売買する取引所を運営している会社です。9月27日に結果を公開し、国内ではGIGAZINEが「AIに『推測するな』と指示するだけで…」という見出しで報じました。12
値を1つだけ消したページで検証
調べ方は単純です。1行だけ違うページを2つ用意し、片方にだけ目的の項目を載せました。指示どおりに動くAIなら、載っているページではその値を、載っていないページではnull(空の値)を出力します。1
どちらのページにも、間違えやすい「おとり」を置きました。例えば、価格欄のない商品ページに「以前は493ドル」という旧価格だけを載せました。記事ページには、著者欄の代わりに「ファクトチェック担当」の名前を載せました。こうしたページを7種類、計42組作り、項目のないページで存在しない値が何件出るかを数えました。1
合計は7割から2割に
1文の有無で、差がはっきり出ました。旧価格のページでは、1文がないと16モデルすべてが493ドルを現在の価格と答えましたが、1文を足すと1モデルに減りました。1
| 条件 | ページにない値を作り出した件数 | 割合 |
|---|---|---|
| 1文なし | 573件中405件 | 70.7% |
| 1文あり | 574件中116件 | 20.2% |
1文があっても、5件に1件は存在しない値を作り出しています。モデルごとの差も大きく、最も少ないモデルで36件中1件、最も多いモデルで36件中19件でした。1
数字を読むときの注意
この数字は、1回だけの実験の結果です。実験した会社も、実験を繰り返していないこと、自分たちで作ったページで試したことを断っています。実際のサイトでは結果が変わるかもしれません。1
また、項目が載っているページで正しく抜き出せた割合は示されていません。1文を足したことで、載っている値までAIが空欄にしてしまう例が増えたかどうかは分かりません。1
AIがもっともらしい値で空欄を埋める理由は、OpenAIの研究者らが2025年の論文で説明しています。AIの性能を測るテスト(ベンチマーク)の多くでは、「分からない」と答えると0点で、当てずっぽうが当たれば得点になります。論文は、そのためにAIが分からないときに推測する癖を身につけやすいとしています。3
請求書の転記で起きること
同じ誤りは、取引先から届く書類をAIに読ませ、会計ソフトや表計算ソフトに転記する仕事でも起こりえます。例えば、毎月50通ほどのPDFの請求書から支払予定表を作る経理担当者なら、次のような項目を取り違えるおそれがあります。
| 実験のおとり | 請求書で似ている項目 |
|---|---|
| 以前は493ドル(旧価格) | 「前回御請求額」「繰越金額」 |
| ファクトチェック担当の名前 | 「担当者」「発行者」の欄 |
表の左は実験のおとりで、右は筆者が似ていると考えた請求書の項目です。読み取るべき欄とは別の数字や名前を、AIが拾ってしまうおそれがあります。
インボイス制度では、仕入税額控除を受けるために、売手の登録番号などが記載されたインボイスの保存が必要です。5 AIが登録番号の欄を推測で埋めると、誤った番号のまま処理が進むおそれがあります。登録番号は国税庁の公表サイトで、Tを除く13桁を入力して検索できます。6 会計ソフトへの登録(仕訳)までAIに任せるときの設定は、freee MCPでできることと先に済ませる設定で取り上げています。
指示に1文を足し、確認は二重に
まず、指示に「書類に書かれていない項目は空欄にし、推測しないでください」と書き足しましょう。 Anthropicの公式ドキュメントも、「わかりません」と言うことを許可するよう勧めており、誤った情報を大幅に減らせるとしています。4
空欄と記入済みの項目で確認方法を分ける
1文を足しても、AIが転記した内容の確認は省けません。5件に1件は、空欄にすべき項目にAIが値を入れるためです。確認は次の2つに分けておきましょう。
- AIが空欄にした項目は、担当者が受け取った請求書を見て入力します
- 値が入った項目は、別のAIか担当者が請求書と突き合わせます
別のAIにページと突き合わせさせる
実験では、AIが出した値がページに実際にあるかを、別のAIに確かめさせています。作り出された値49件のうち38件を見抜き、正しい値47件を誤りとしたことは一度もありませんでした。126件の回答の確認にかかった費用は0.0049ドルです。1ドル=150円で換算すると、1件あたり0.01円に満たない額です。1
選択肢から答えを選ぶことに特化したAI「Jev」に確かめさせたところ、49件中23件を見抜きました。一方、「調理時間」を「下ごしらえの時間」と答えたような意味の近い取り違え6件は、すべて見逃しました。1 Jevの向き不向きは、文章を書かないAI「Jev」の使いどころにまとめました。
自社の請求書で試す
この1文が自社の請求書でも効くかどうかは、実験と同じやり方なら10分ほどで確かめられます。過去の請求書を1枚選び、登録番号の行だけを消したコピーを作ります。両方をAIに読ませ、1文の有無でコピーの登録番号の欄が空欄になるかを比べましょう。
結果に応じて、次のように進めましょう。
- 1文を足した指示でコピーの登録番号の欄が空欄になれば、二重チェックの手順を組んだうえで使い始められます
- 1文を足しても登録番号が埋まるなら、その書類はAIに任せず、人が入力しましょう
- 1桁の誤りが支払額を左右する項目は、検査記録の測定値にはAIを触れさせないという考え方で扱うほうが安全です
出典
- Earn an Honest Dollar「Calling the AI bluff: "Do not guess" cut made-up fields from 70.7% to 20.2%」(2026年9月27日)(参照 2026-09-29)
- GIGAZINE「AIに『推測するな』と指示するだけで架空データが70%から20%に減少したという実験結果」(2026年9月28日)(参照 2026-09-29)
- Kalai ほか「Why Language Models Hallucinate」(arXiv 2509.04664・2025年9月4日)(参照 2026-09-29)
- Claude Platform Docs「ハルシネーションを減らす」(参照 2026-09-29)
- 国税庁「インボイス制度について」(参照 2026-09-29)
- 国税庁「インボイス制度 適格請求書発行事業者公表サイト」(参照 2026-09-29)

