AI Post
LaunchChatGPT3일 전

GPT-Red 공개 — OpenAI, AI가 AI 취약점 찾는 자동 레드팀 모델 도입

출처: OpenAI

OpenAI가 AI 보안 연구의 새로운 이정표가 될 'GPT-Red'를 공개했다. GPT-Red는 AI 시스템의 취약점을 자동으로 찾아내도록 특화 훈련된 레드팀 모델로, 인간 레드팀원의 한계를 넘어 훨씬 빠르고 광범위하게 공격 패턴을 생성할 수 있다.

핵심 훈련 방식은 '자기 대결 강화학습(self-play RL)'이다. GPT-Red(공격자)와 다양한 방어 모델이 동시에 훈련되면서, 공격자가 새로운 취약점을 찾으면 방어자가 이를 막는 방식을 반복한다. 공격자가 강해질수록 방어자도 함께 강해지는 구조다.

GPT-Red의 성능은 실전 테스트에서도 입증됐다. 간접 프롬프트 인젝션 벤치마크에서 인간 레드팀원은 13%의 시나리오에서만 성공한 반면, GPT-Red는 84%에서 성공했다. OpenAI 사무실의 AI 자판기(Vendy)를 공격해 가격 조작과 타인 주문 취소 등 세 가지 악의적 목표를 모두 달성하기도 했다.

OpenAI는 GPT-Red를 GPT-5.6 훈련 과정에 직접 적용했다. 그 결과 GPT-5.6 Sol은 가장 어려운 직접 프롬프트 인젝션 벤치마크에서 4개월 전 모델 대비 실패율이 6배 감소했다. GPT-Red 자체의 공격에 대한 저항성도 급격히 높아져, 현재 GPT-5.6 Sol은 GPT-Red 직접 공격의 0.05%에서만 실패한다.

OpenAI는 GPT-Red를 배포 모델과 완전히 분리해 유지하겠다고 밝혔다. 악의적 능력을 특화 훈련한 이 모델을 외부에 노출하지 않으면서, 그 성과만 미래 GPT 모델의 안전성 강화에 활용하는 방식이다. OpenAI는 "AI 역량이 스케일링을 통해 향상되듯, 안전성도 이 자동화 선순환 구조를 통해 함께 스케일링될 것"이라고 밝혔다. 상세 논문은 이번 주 중 공개 예정이다.

광고
AdSense slot: article-bottom
이 AI 에 대해

가장 널리 쓰이는 범용 AI 대화 서비스.

이 AI 의 역사

관련 기사

LaunchGemini6일 전

DeepMind, 인도 1,100만 학생 위한 Gemini 기반 AI 교사 도우미 'ATL Saathi' 파일럿 출시

출처: Google DeepMind Blog
LaunchClaude6일 전

Anthropic, 미국 K-12 교사를 위한 'Claude for Teachers' 무료 출시

출처: Anthropic News
LaunchClaude6일 전

Claude for Teachers 출시 — 미국 초중고 교사에게 무료 프리미엄 AI 제공

출처: Anthropic News