1. OpenAIが実際に構築したもの
GPT‑Redは一般提供される製品でも新しい会話モデルでもない。他のモデルやエージェントを攻撃するための社内モデルだ。攻撃を送り、防御側の応答やツール呼び出しを観察し、試行を更新する。攻撃者と複数の防御モデルを強化学習で同時に訓練し、検証可能な失敗を起こせば攻撃者が、操作を拒みつつ元の仕事を終えれば防御者が報酬を得る。
運用上の新規性は規模にある。人間が固定テスト集を書くのを待たず、訓練中に攻撃を生成し、推論計算を増やして弱点を探索できる。論文は安全訓練にOpenAIの大規模な事後学習に匹敵する計算資源を使ったとする。費用、モデル詳細、重みは非公開で、意図的に訓練した攻撃能力を広げないようGPT‑Redを提供モデルから分離している。
2. 攻撃者・防御者ループの仕組み
各環境は、攻撃者が操作できる場所と成功と数える行動を定めた脅威モデルから始まる。悪意ある内容はローカルファイル、ウェブのバナー、メール本文、ツール出力に潜み得る。間接プロンプトインジェクションは利用者自身が送る必要がない。エージェントが調査するデータの中に敵対的指示を置けるからだ。
GPT‑Redは単一モデルではなく多様な防御モデル群と訓練する。特定の癖への過適合を抑え、標的の挙動に合わせて戦略を変えさせる狙いだ。成功した攻撃は防御学習のデータになる。防御が強まれば攻撃者は探索を広げ、攻撃が成功すれば次の製品モデルはより難しい例を得る、小さな軍拡競争である。
- 操作面:ページ、メール、ファイルなど攻撃者が汚染できる経路を定める。
- 目的:秘密の流出や無許可の実行など測定可能な失敗を定義する。
- 探索:一度の入力ではなく複数の変形を試し、防御側を観察する。
- 訓練:成功した攻撃を製品モデルの堅牢化に戻す。
3. 数字が示すこと、示さないこと
OpenAIが社内で再現した2025年の間接注入課題では、GPT‑Redと人間のレッドチームが訓練外シナリオでGPT‑5.1を攻撃した。OpenAIの報告はGPT‑Redが84%、人間が13%のシナリオで成功したとする。一方、論文の注記はGPT‑Redが常に人間より優れるとは限らず、人間は自動システムが想定しない新しい攻撃クラスを見つけ得ると明記する。
敵対的学習後、OpenAIは報告評価でGPT‑5.6 SolがGPT‑Redの直接注入の0.05%に失敗したと述べた。「偽の思考連鎖」攻撃はGPT‑5.1で95%超の成功率だったものがGPT‑5.6 Solで10%未満になったという。これは供給者が自社モデルと指標で得た結果だ。現実の攻撃の99.95%を防ぐ統計保証ではなく、ツール、記憶、認証、データの全組み合わせも網羅しない。
4. ベンチマークより危険を示す自動販売機
OpenAIは社内の自動販売機を管理する実運用エージェントにGPT‑Redを投入した。シミュレーションで反復後に移した攻撃は、高価な商品を0.50ドルに変更し、100ドル超の商品を仕入れて同額で販売し、別の顧客注文を取り消す三つの目的を達成した。論文によると、信頼済み管理者からのメッセージに見せた偽のメタデータを使った。OpenAIは脆弱性を通知し、新しい保護策を試験中だとしている。
GPT‑RedはGPT‑5.4 miniベースのCodex CLIエージェントも、保留していた10件のデータ流出課題で攻撃し、プロンプトだけを与えたGPT‑5.5基準より成功度とトークン効率が高かった。10例は普遍的な侵害率ではない。重要なのは、エージェントがツールを持つとモデルの誤りが悪い回答ではなく、価格変更、注文取消、ファイル流出になることだ。
5. 0.05%の陰に隠してはいけない空白
論文はGPT‑Redの訓練がマルチモーダル環境、複数ターン攻撃、コンテンツポリシーの脱獄では少ないと明記する。評価の多くは内部実施で、実行可能な攻撃プロンプトや攻撃モデルも安全上公開されない。拡散リスクを抑える一方、独立した再現性は低くなる。
より根本的なのは分布変化だ。新しい攻撃は画像、共有文書、外部プラグイン、エージェント間プロトコル、一つずつは無害に見える長い行動列から来るかもしれない。モデルが悪意ある文を拒んでも認証層やツール接続で負ける可能性がある。企業はモデル単体でなくシステム全体を測り、いつか一部の注入が成功する前提で設計すべきだ。
6. 企業と政府が今すべきこと
NISTの分類も慎重な読み方を支持する。現在の緩和策は間接注入を完全には防げないため、モデルが敵対的内容に触れると仮定して設計する。汎用エージェントにメール、ファイル、決済の恒常権限を与えず、読み取りと実行を分離する。未信頼の文脈を示し、最小権限と短期認証を使い、送金、削除、公開には人の承認を求める。
日本とアジアの導入では、日本語、混在文字、縦書きや表、スキャン文書、業務チャットを現地試験に含める必要がある。英語ベンチマークで強いモデルでも、日本語の請求書や二言語文書に隠れた指示へ従うかもしれない。良い調達は供給者の総合点だけでなく、指標の境界、購入者データでの独立試験、事故記録、ツールや権限を失効させる時間を求める。
- モデル単体でなく、データ源から実行までの経路を試験する。
- 機密ツールを分離し、書込み・削除・決済に承認を置く。
- 各判断とツール呼び出しに影響した情報源を記録する。
- モデル、プロンプト、ツール、接続先を変えるたび再試験する。
- 現地語、マルチモーダル入力、長い会話を評価に含める。
7. 戦略的シグナル:エージェント安全試験市場
GPT‑Redは安全性が公開前の文書から常時稼働する計算基盤へ変わる方向を示す。重要なエージェントには自動対戦相手、シミュレーション、失敗判定、保留セット、運用監視が必要になる。セキュリティと評価のサービス市場が生まれる一方、顧客が監査できない閉鎖指標を増やす誘因もある。
防御可能な主張は「注入不可能」ではなく、有用な仕事を止めずに早く発見、封じ込め、修復できることだ。投資家は評価ツールが実際の開発と調達に入るかを見たい。規制当局は再現可能な証拠と行動責任を重視すべきだ。自動攻撃者の強化が防御側に朗報となるのは、その防御成果が供給者の研究室外でも測れる場合に限られる。