Fable 5 사이버 보안 정책 강화 — 젤브레이크 심각도 프레임워크 공개
출처: Anthropic News
Anthropic이 재배포된 Claude Fable 5의 사이버보안 보호 정책을 더욱 구체화했다. 2026년 7월 2일 공개된 공식 발표에 따르면, 사이버보안 영역에서 허용과 차단 기준을 정교하게 분류한 새로운 안전 분류 체계가 도입됐다.
새 분류 체계는 네 가지 범주로 구성된다. △완전 금지 용도(악성코드 개발, 인프라 공격 지원 등) △고위험 이중활용 활동 △저위험 이중활용 작업 △무해한 일반 활용이다. Anthropic은 공격자와 방어자가 동일한 기능을 필요로 하는 "이중활용 딜레마"를 인정하면서, 일부 합법적 용도까지 차단하는 "안전 마진" 원칙을 유지한다고 밝혔다.
함께 공개된 "사이버 젤브레이크 심각도(Cyber Jailbreak Severity, CJS)" 프레임워크는 AI 안전망을 우회하는 젤브레이크 공격의 위험도를 체계적으로 평가한다. 능력 획득 규모, 능력의 범위, 무기화 용이성, 발견 가능성 등 네 가지 차원에서 심각도를 측정하며, CJS-0(정보적)부터 CJS-4(심각)까지 5단계로 등급을 부여한다.
Anthropic은 이 프레임워크를 업계 파트너들과 공동 개발했으며, 현재 조기 단계라고 밝혔다. 보안 연구자들이 잠재적 취약점을 신고할 수 있는 HackerOne 프로그램도 운영 중이다.
광고
AdSense slot: article-bottom
이 AI 에 대해
긴 글을 잘 다루는 고품질 AI 어시스턴트.