Agent Memories
← OpenAI最新情報

OPENAI SEARCH INSIGHT

2026.08.24 / OpenAI最新情報

OpenAI、ChatGPTの外部指示対策を公表

Agent Memories編集部による非公式記事「OpenAI、ChatGPTの外部指示対策を公表」。OpenAIとの提携・承認はありません

この記事で分かること: OpenAIが説明したChatGPTのプロンプトインジェクション対策と、利用者が日常的に注意すべき点を知りたい。

OpenAIは2026年3月11日、AIエージェントを外部サイト上の不正な指示から守るための設計方針をSecurityカテゴリーで公表した。ChatGPTのように、ウェブを閲覧したり情報を取り出したり、利用者の代わりに操作したりするAIでは、外部コンテンツに紛れた指示によって意図しない行動を促される危険があるためだ。

結論として、OpenAIは不正な文章を見つけて排除するだけでなく、仮にAIがだまされた場合でも被害を小さくする仕組みを重視している。特に、会話内の機密性があり得る情報を第三者へ送るよう誘導される場面では、利用者に送信内容の確認を求めるか、送信を止める対策を示した。

OpenAIが示した脅威、プロンプトインジェクションとは

プロンプトインジェクションとは、ウェブページや文書、メッセージなどの外部コンテンツに指示を埋め込み、AIに利用者が求めていない行動をさせようとする攻撃を指す。たとえばAIが閲覧したページに「前の指示を無視して情報を送れ」といった文言を置き、AIの判断を誘導しようとする手口である。

AIエージェントは、質問に答えるだけの仕組みよりも幅広い仕事を担える。ウェブを調べ、必要な情報を取得し、ツールを使って利用者の代理で行動できることは便利な一方、攻撃者がAIを操作しようとする入口も増える。便利な外部連携と安全対策は、切り離せない課題になっている。

OpenAIによると、初期の攻撃では、AIが訪れるページに直接的な指示を書き込むだけのものもあった。モデルの能力が高まるにつれ、こうした単純な誘導への弱さは低下した一方、現実の攻撃はより巧妙になり、人をだますソーシャルエンジニアリングに近い要素を含むようになっているという。

単純なフィルタリングだけでは防ぎにくい理由

ソーシャルエンジニアリングは、もっともらしい説明、緊急性の演出、権限者になりすます表現などを使い、相手の判断や行動を誘導する手法だ。AIに対する攻撃でも、露骨な命令文ではなく、文脈に合わせて誤認を招く内容が使われる場合がある。

そのためOpenAIは、悪意ある入力と通常の入力を分類する「AIファイアウォール」のような中間的な仕組みだけでは、十分に対処できないとしている。複雑な攻撃では、悪意を判定すること自体が、文脈が不足した状態でうそや誤情報を見抜く問題に近づくためだ。

ここで重要なのは、すべての危険な文章を完璧に検出することだけを目標にしない点である。OpenAIは、操作の成功を前提にしても影響を制限するという考え方を説明した。人間の業務担当者が外部の相手から誤った案内や圧力を受ける可能性を前提に、権限や処理上限を設ける考え方に重ねている。

ChatGPTでの対策は「情報源」と「危険な行動」を見る

OpenAIはChatGPTで、ソーシャルエンジニアリングへの対処と、セキュリティ設計における「source-sink analysis」を組み合わせていると説明する。これは、システムに影響を与えられる情報の入口と、不適切な状況で使われると危険になる機能や行動の出口を結び付けて考える方法だ。

AIエージェントでは、信頼できない外部コンテンツが入口になり得る。そこに、第三者への情報送信、リンクを開く操作、外部ツールとの連携といった行動が組み合わさると、リスクが高まる。OpenAIは、危険な操作や機微な情報の送信が、利用者に見えないまま起きないことを中核的な安全上の期待として掲げている。

OpenAIが把握しているChatGPTへの攻撃では、会話中の秘密情報を取り出し、悪意ある第三者へ送るようAIを説得しようとする試みが多いという。多くの場合は安全学習によってAIが拒否するが、仮にAIが説得された場合に備えた追加策も用意している。

Safe URLで送信前の確認・遮断を行う

OpenAIは追加の軽減策として「Safe URL」を挙げた。これは、AIが会話から得た情報を第三者へ送信しようとしている状況を検出するために設計された仕組みだ。OpenAIの説明では、このようなまれなケースで送信が問題になり得ると判断されると、対応は二つに分かれる。

これは、AIが外部ページの内容を読んだこと自体を危険とみなすのではなく、読み取った内容がどの行動につながるかを重視する設計といえる。外部情報の閲覧と第三者送信を同じリスクとして扱わない点が、利用者の利便性と安全性を両立させるための考え方となる。

一般のChatGPT利用者に関係すること

この発表は、普段の会話だけでChatGPTを使う人にも関係する。とりわけ、ウェブ上の情報を参照する作業、外部サービスやツールに関わる作業、文書やメールの内容を扱う作業では、AIが目にした情報の中に利用者の目的と無関係な誘導が混じる可能性を意識したい。

今日からできる基本は、AIが外部へ情報を送る前に確認画面や内容表示があれば、宛先と送信内容を読むことだ。「急いで送信する必要がある」「確認を省略してよい」といった外部コンテンツ上の文言は、それ自体が利用者の依頼ではない。最終的な送信・共有の判断は利用者が担うという姿勢が重要になる。

また、会話に入力する情報も必要最小限にする。パスワード、認証コード、個人情報、取引先との秘密情報などを、用途や必要性を確認せずに入力しないことが基本となる。OpenAIの発表は、すべての攻撃を完全に防げると述べたものではなく、複数の防御で被害の可能性と影響を抑える方針を説明したものだ。

Agent Memories編集部の考察

公式発表で明確なのは、OpenAIがAIの賢さだけに安全を委ねず、権限管理、送信時の確認、遮断といったシステム側の制約を重視していることだ。これは、人間がだまされる可能性を前提に業務フローを設計する考え方に近く、AI利用が実務へ広がるほど重要性を増すだろう。

編集部としては、利用者にとって「AIが拒否したか」だけでなく、「何をどこへ送ろうとしているかを把握できるか」が実用上の焦点になると考える。確認が求められた際は単に許可するのではなく、情報の種類、送信先、依頼との関係を照らし合わせることが望ましい。

一方で、OpenAIの今回の説明には、Safe URLの具体的な利用可能範囲、設定方法、提供条件は記載されていない。したがって、利用者は特定の操作で必ず確認や遮断が行われると期待し過ぎず、AIの出力や提案を重要操作の最終承認と取り違えないことが必要だ。

よくある質問

プロンプトインジェクションは、利用者が悪い指示を入力することですか?

必ずしもそうではない。今回OpenAIが説明した中心的な問題は、AIが閲覧したウェブページや外部文書などに埋め込まれた指示である。利用者が依頼していないのに、外部コンテンツがAIの行動を変えようとするケースを想定している。

ChatGPTが危険な外部指示をすべて見抜けるようになったのですか?

OpenAIは、完全な検出だけに依存しない方針を示している。攻撃が成功する可能性も考慮し、危険な送信や操作の影響を抑える設計を組み合わせる。したがって、利用者側も送信確認や共有範囲の確認を続ける必要がある。

確認を求められたら、何を確認すればよいですか?

送信先が意図した相手か、送る内容に機密情報や不要な個人情報が含まれていないか、そもそも自分がその送信を依頼したかを確認したい。依頼と関係のないURL、宛先、緊急性を強調する説明があれば、許可せず作業を見直すのが無難だ。

企業がAIエージェントを導入する場合の示唆は何ですか?

OpenAIは、アプリケーションにAIモデルを組み込む際、人間の担当者なら同様の場面でどのような制御を受けるべきかを考え、その制御を実装するよう勧めている。権限の範囲、処理の上限、確認手順、異常時の遮断を事前に設計することがポイントとなる。

まとめ

OpenAIは、AIエージェントへのプロンプトインジェクションが、単純な命令の上書きからソーシャルエンジニアリングを含む複雑な誘導へ変化していると説明した。ChatGPTでは安全学習に加え、危険な情報送信を確認または遮断する仕組みを通じ、外部からの操作による影響を抑える方針を示している。

利用者が実践できるのは、外部へ送る情報と宛先を確認し、必要以上の機密情報を会話へ入力せず、AIの提案をそのまま重要操作として実行しないことだ。AIに任せられる範囲が広がるほど、便利さと同時に、確認すべき場面を見極めることが安全な利用につながる。

公式出典・確認日

OpenAI公式情報を2026-08-24時点で確認しています。提供範囲・料金・画面は更新される場合があります。

新しいAIへ乗り換えても、自分の前提や判断を持ち運べる状態をつくる。Agent Memoriesは、記憶をスキルや外部ツールへつなぐAIパートナー基盤を育てています。

AIエージェントの記憶を知る Agent Memoriesを見る

本カテゴリはMiraigent / Agent Memoriesによる非公式編集記事です。OpenAIとの提携・承認・後援を示すものではありません。