TOP › UX用語 › コンテキスト汚染攻撃

コンテキスト汚染攻撃 Context Poisoning Attack

AIが後から読み返す記憶や会話に指示を仕込み、以後の動きを操る攻撃

コンテキスト汚染攻撃(Context Poisoning Attack)とは、AIが後から読み返す記憶や会話に指示を残すことで、以後の応答や行動を攻撃者の思いどおりに動かす攻撃である。

旅行の予約を手伝うAIエージェントで考える。攻撃者は、予約情報を自身のサイトに送る指示を、画面には表示されない形で埋め込んだWebページを用意する。利用者がそのページのURLをエージェントに渡すと、指示は会話の要約に紛れ込み、エージェントの記憶に残る。数日後、利用者が新しい旅行を予約しに戻ってくると、エージェントは予約情報を攻撃者のサイトへ黙って送る。

土台にあるのは、AIが取り込みそうなデータに指示を仕込む「間接プロンプトインジェクション」である。コンテキスト汚染攻撃は、仕込んだ指示が記憶や会話に残り、あとの会話でも効き続ける点がただのプロンプトインジェクションとは異なる。

要約に紛れた指示が、次の会話の前提になる

要約に紛れた指示が、次の会話の前提になるのイメージ

AIは、外部から読み込んだ文章に書かれた一文を、正当な指示と取り違えることがある。この攻撃のもとになる間接プロンプトインジェクションを2023年に示した研究は、AIを組み込んだアプリでは、読み込むデータと従うべき指示の境目があいまいになると指摘した。

予約エージェントの例では、Webページに埋め込まれた指示が、会話の要約を作る処理を操る。その結果、要約の中に攻撃者の指示が入る。要約は記憶として残り、次の会話でエージェントが受け取る指示文の一部になる。

似た言葉に、AI自身の作り話や誤りが文脈に入り、繰り返し参照される「文脈の汚染」がある。コンテキスト汚染攻撃は、同じ状態を攻撃者が意図して作る点で、こちらとは別のものである。

語源・提唱者

元々「context poisoning」という言葉には、攻撃ではなく、AIの失敗を指す使い方であった。GoogleはGemini 2.5の技術レポートで、ポケモンを遊ぶエージェントの目標や要約が、ゲームの状況についての誤りで汚れていく状態をこう呼んだ。

アメリカの非営利の研究機関MITREマイター は、AIへの攻撃の手口を実例にもとづいて整理した一覧「ATLAS」の中で、コンテキスト汚染攻撃をあげた。AIエージェントが使う文脈を操作し、応答や行動に影響を与える手法という定義である。

OWASPオワスプ の生成AIセキュリティプロジェクト(Gen AI Security Project)は、2025年12月に公表したAIエージェント向けの10大リスクで、6番目に「Memory & Context Poisoning」を挙げた。この項目の担当者は、問題の核心を「悪意ある内容を一度見たこと」ではなく「それが残り続けること」に置いている。

仕込みから数日後に、黙って効く

仕込みから数日後に、黙って効くのイメージ

コンテキスト汚染攻撃では、仕込んだ時期と被害が出るタイミングが異なる。OWASPも、記憶の汚染は最初のやり取りからずっと後になってふるまいを変えたとしている。予約エージェントの検証では、利用者がページを渡してから数日後の別の会話で、予約情報が送られた。

仕込みは利用者から見えない。Webページの指示はページの中身に埋め込まれていたが、利用者の画面には出なかった。送信も、エージェントが利用者に知らせずに行った。

効く範囲も1回の会話にとどまらない。OWASPの担当者は、一度の操作が、会話・プロジェクト・再起動をまたいで、その後のAIのふるまいを形づくりうると指摘している。

この検証を行ったセキュリティ企業Palo Alto NetworksのUnit 42は、使ったサービス固有の脆弱性ではなく、エージェントにおけるプロンプトインジェクションという未解決の課題だとしている。

記憶への書き込みを、入口と同じように守る

記憶への書き込みを、入口と同じように守るのイメージ

使いどころは、AIエージェントに記憶を持たせると決めた設計の段階である。OWASPの担当者は、記憶を攻撃される場所の一部とみなし、実行の経路や認証情報と同じ厳しさで調べるよう求めている。

予約エージェントの例に当てはめると、守る場所は3つある。

  • 外部の文章を指示と区別して渡す:URLで渡されたページの文章を、指示と見分けられる形でAIに渡す。Microsoftは、外部の文章の前後に目印を置く、全体に印を付ける、決まった規則で別の文字に置き換える、という方法を使っている。
  • 読み込める先を絞る:Unit 42は、不審なサイトへのアクセスを止める仕組みを挙げている。
  • 記憶への書き込みを記録する:Unit 42は、ログの記録と継続的な監視を挙げている。要約が記憶に書き込まれるたびに記録を残せば、どの会話で何が入ったかを後からたどれる。

Microsoftは、こうした対策を1つに頼らず、予防・検知・被害の抑制にまたがる多層の防御をとっている。

関連用語

  • データポイズニング

プロンプトインジェクション

AIエージェント

BtoB人事業務アプリのコンサルタント→エンジニア→BtoCのWebディレクターを経て、再度BtoB業務アプリとなる物流プラットフォームのUIUXに挑戦。オンライン/オフライン双方でのBtoBUXを改善すべく奮闘中。

「UX用語」のカテゴリー