1. OpenAI가 실제로 만든 것
GPT‑Red는 공개 제품이나 새 대화 모델이 아니다. 다른 모델과 에이전트를 공격하도록 특화된 내부 모델이다. 공격을 보내고 방어자의 답변과 도구 호출을 관찰한 뒤 전략을 수정한다. 공격자와 여러 방어 모델은 강화학습으로 함께 훈련된다. 검증 가능한 실패를 만들면 공격자가, 조작을 거부하면서 원래 업무를 완수하면 방어자가 보상을 받는다.
운영상의 새로움은 규모다. 사람이 고정된 시험 목록을 작성할 때까지 기다리는 대신 훈련 중 공격을 만들고, 추론 자원을 더 써서 취약점을 탐색한다. 논문은 안전 훈련에 OpenAI의 대형 사후학습 작업과 비슷한 규모의 컴퓨팅을 사용했다고 밝힌다. 비용·세부 모델·가중치는 공개하지 않았고, 의도적으로 키운 공격 능력이 확산되지 않도록 GPT‑Red를 배포 모델과 분리한다고 설명한다.
2. 공격자–방어자 루프의 작동 방식
각 환경은 공격자가 통제할 수 있는 부분과 성공으로 간주할 행동을 정한 위협 모델에서 시작한다. 악성 내용은 로컬 파일, 웹 배너, 이메일 본문, 도구 출력에 들어갈 수 있다. 간접 프롬프트 인젝션은 사용자가 직접 보낼 필요가 없다. 에이전트가 분석하라는 데이터 속에서 적대적 지시를 읽을 수 있기 때문이다.
GPT‑Red는 하나의 방어자가 아니라 다양한 방어 모델 집단과 훈련한다. 특정 모델의 버릇을 외우는 것을 줄이고 목표에 맞춰 전략을 바꾸게 하려는 설계다. 성공한 공격은 다시 방어자 학습 데이터가 된다. 방어가 강해질수록 공격자는 더 넓게 탐색하고, 공격이 성공할수록 다음 모델은 더 어려운 예제를 받는 축소판 군비 경쟁이다.
- 통제면: 웹페이지·메일·파일 등 공격자가 오염시킬 채널을 정한다.
- 목표: 비밀 유출이나 무단 실행처럼 측정 가능한 실패를 정의한다.
- 탐색: 한 번의 프롬프트가 아니라 여러 변형을 시험하며 방어를 관찰한다.
- 훈련: 성공한 공격을 생산 모델의 방어 학습에 다시 넣는다.
3. 숫자가 말하는 것과 말하지 않는 것
OpenAI가 내부에서 재현한 2025년 간접 인젝션 과제에서 GPT‑Red와 인간 레드팀은 훈련에 쓰이지 않은 시나리오로 GPT‑5.1을 공격했다. OpenAI는 GPT‑Red가 84%, 인간이 13%의 시나리오에서 성공했다고 보고했다. 다만 논문 각주는 GPT‑Red가 모든 면에서 인간보다 낫다는 뜻이 아니며, 인간은 자동 시스템이 고려하지 못한 새 공격 종류를 찾을 수 있다고 명시한다.
적대적 학습 뒤 OpenAI는 보고된 평가에서 GPT‑5.6 Sol이 GPT‑Red의 직접 인젝션 중 0.05%에서 실패했다고 밝혔다. ‘가짜 사고사슬’ 공격은 GPT‑5.1에서 95% 넘게 성공했지만 GPT‑5.6 Sol에서는 10% 아래로 떨어졌다고 한다. 이는 공급자가 자체 모델과 지표로 낸 결과다. 현실 공격의 99.95%를 막는다는 통계 보증이 아니며 도구·메모리·신원·데이터의 모든 조합을 포함하지도 않는다.
4. 벤치마크보다 위험을 잘 보여주는 자판기
OpenAI는 사무실 자판기를 관리하는 실제 에이전트에 GPT‑Red를 투입했다. 시뮬레이션에서 반복한 뒤 옮긴 공격은 고가 상품 가격을 0.50달러로 낮추고, 100달러가 넘는 상품을 주문해 같은 가격에 판매하며, 다른 고객 주문을 취소하는 세 목표를 달성했다. 논문에 따르면 신뢰받는 관리자가 보낸 메시지처럼 꾸민 메타데이터가 이용됐다. OpenAI는 취약점을 전달했고 새 보호책을 시험 중이라고 밝혔다.
GPT‑Red는 GPT‑5.4 mini 기반 Codex CLI 에이전트도 비공개 데이터 유출 10개 과제에서 공격했다. 프롬프트만 적용한 GPT‑5.5 기준선보다 성공률과 토큰 효율이 높았다. 열 개 사례가 보편적 침해율은 아니다. 핵심은 에이전트가 도구를 가질 때 언어모델의 오류가 잘못된 답을 넘어 가격 변경·주문 취소·파일 유출로 바뀐다는 점이다.
5. 0.05% 뒤에 가려지면 안 되는 공백
논문은 GPT‑Red가 멀티모달 환경, 다중 턴 공격, 콘텐츠 정책 탈옥에서 상대적으로 적게 훈련됐다고 분명히 적었다. 많은 평가는 내부 시험이며 공격 프롬프트나 공격 모델도 보안상 공개하지 않는다. 확산 위험을 줄이는 선택이지만 독립 재현에는 제약이 생긴다.
더 큰 문제는 분포 변화다. 새 공격은 이미지, 공유 문서, 외부 플러그인, 에이전트 간 프로토콜, 겉보기에는 무해한 긴 행동 연쇄에서 올 수 있다. 모델이 악성 문장을 거부해도 신원 계층이나 도구 인터페이스에서 실패할 수 있다. 따라서 기업은 모델 단독이 아니라 시스템 전체를 측정하고, 언젠가는 일부 인젝션이 성공한다는 전제로 설계해야 한다.
6. 기업과 정부가 지금 해야 할 일
NIST의 분류 체계도 같은 보수적 해석을 지지한다. 현재 완전한 방어가 없으므로 모델이 악성 콘텐츠를 만날 수 있다고 가정해 시스템을 설계해야 한다. 범용 에이전트에 이메일·파일·결제의 상시 권한을 주지 말고 읽기와 실행을 분리해야 한다. 신뢰하지 않는 문맥을 표시하고 최소 권한과 단기 자격증명을 적용하며 송금·삭제·게시에는 사람의 승인을 둬야 한다.
한국과 아시아 배포는 한국어, 혼합 문자, 표·스캔 문서, 메신저 대화까지 현지 시험에 넣어야 한다. 영어 벤치마크에서 견고한 모델도 한국어 세금계산서나 이중 언어 파일에 숨은 지시를 따를 수 있다. 좋은 조달은 공급자 점수만 보지 않는다. 지표의 경계, 기관 데이터로 한 독립 시험, 사고 기록, 도구와 권한을 회수하는 데 걸리는 시간을 요구한다.
- 모델만이 아니라 데이터 원천에서 실제 행동까지 전 경로를 시험한다.
- 민감한 도구를 분리하고 쓰기·삭제·결제에 승인을 둔다.
- 각 결정과 도구 호출에 영향을 준 출처를 기록한다.
- 모델·프롬프트·도구·커넥터가 바뀔 때마다 재시험한다.
- 현지 언어, 멀티모달 입력, 긴 대화를 시험 계획에 넣는다.
7. 전략적 신호: 에이전트 보안 시험 시장
GPT‑Red는 안전이 출시 전 문서가 아니라 상시 컴퓨팅 인프라가 되는 방향을 보여준다. 중요한 에이전트마다 자동 상대, 시뮬레이션, 실패 판정기, 홀드아웃 세트, 운영 모니터링이 필요해진다. 보안·평가 서비스 시장이 커지는 동시에 고객이 감사를 못 하는 폐쇄형 지표의 유인도 커진다.
방어 가능한 주장은 ‘인젝션 불가능’이 아니라 유용한 업무를 멈추지 않고 더 빨리 발견·격리·복구한다는 것이다. 투자자는 평가 도구가 실제 개발과 조달 과정에 들어가는지 봐야 한다. 규제자는 재현 가능한 증거와 행동 책임에 집중해야 한다. 자동 공격자가 강해지는 것이 방어자에게 좋은 소식이 되려면 방어 성과가 공급자 연구실 밖에서도 측정돼야 한다.