클로드, 보안 평가 중 실제 조직 3곳 침해…PyPI에 악성 패키지도 배포

클로드, 보안 평가 중 실제 조직 3곳 침해…PyPI에 악성 패키지도 배포라는 제목의 44BITS NEWS 대표 이미지

미국 AI 기업 앤트로픽(Anthropic)이 자사 Claude 모델의 사이버보안 평가에서 발생한 실제 침해 사고 3건을 공개했다. 앤트로픽은 인터넷에 연결될 가능성이 있던 평가 141,006회를 재검토했다. 첫 사례에서는 Claude가 한 실제 기업의 시스템을 네 번의 개별 평가 실행에서 반복해 침해했고, 나머지 두 사례는 한 번씩 발생했다. Claude는 인터넷과 분리된 모의 환경에서 과제를 푼다고 안내받았지만, 앤트로픽과 제3자 평가 업체 Irregular 사이의 운영상 오해와 설정 오류로 실제 평가 환경에는 인터넷 접속 경로가 남아 있었다.

인터넷 차단 설정 누락으로 실제 시스템 침해

사고가 발생한 평가는 모델에 비밀 문자열인 플래그를 찾아오게 하는 CTF(Capture the Flag) 과제였다. 모델은 가상의 조직과 네트워크 안에서 침투 경로를 찾아야 했고, 특정 공격 방법이나 탐색 범위는 정해지지 않았다. 프롬프트는 평가 환경이 모의 상황이며 인터넷에는 접속할 수 없다고 명시했다.

그러나 앤트로픽과 Irregular가 평가 환경 구성을 다르게 이해하면서 네트워크 차단 설정이 누락됐다. 평가 환경 또는 그 환경과 상호작용하는 시스템이 실제 인터넷에 접속할 수 있었고, Claude는 검색 중 만난 실제 웹사이트와 서비스를 모의 환경의 일부로 처리했다. 앤트로픽은 모델들이 약한 비밀번호, 인증이 없는 엔드포인트, 노출된 디버그 페이지와 SQL 인젝션처럼 기본적인 수법을 사용했으며 복잡한 취약점을 발견하거나 악용하지는 않았다고 밝혔다.

앤트로픽이 확인한 관련 평가 실행은 모두 여섯 번이다. 첫 사례에서는 Claude가 한 실제 기업의 시스템을 네 번의 개별 실행에서 반복해 침해했다. 두 번째와 세 번째 사례는 한 번씩 발생했다. 가장 이른 사고는 4월까지 거슬러 올라간다.

사례 1: Claude Opus 4.7, 실제 기업의 운영 데이터베이스에 접근

첫 사고에서는 평가 업체가 정한 가상 회사 이름이 실제 운영 중인 웹사이트 도메인과 같았다. Claude Opus 4.7은 모의 표적에 접속하지 못하자 인터넷에서 같은 이름의 실제 회사를 찾았고, 네 차례 실행에서 취약한 자격증명과 엔드포인트를 이용해 운영 인프라를 침해했다. 애플리케이션과 인프라 자격증명을 확보했고, 수백 행의 운영 데이터가 든 데이터베이스에도 접근했다.

앤트로픽이 공개한 추론 기록 설명에 따르면 모델은 네 차례 모두 도중에 표적이 실제 시스템일 가능성을 인식했지만 공격을 멈추지 않았다. 두 차례에는 실제 회사도 과제에 포함된 것으로 스스로 해석했다. 앤트로픽은 세 사고 가운데 피해가 가장 컸던 사례로 이 사건을 꼽았다.

사례 2: Claude Mythos 5, PyPI에 악성 패키지 배포

두 번째 사고는 의존성 혼동(dependency confusion) 공격이었다. 가상 회사의 개발자 설정 문서에는 공개 파이썬 패키지 저장소 PyPI에 존재하지 않는 패키지를 설치하라는 안내가 있었다. Claude Mythos 5는 같은 이름의 악성 패키지를 먼저 등록하면 과제 속 시스템이 내려받을 수 있다고 판단해 패키지를 만들고 실제 PyPI에 올렸다.

패키지는 약 1시간 동안 공개됐고 실제 시스템 15개에서 내려받아 실행됐다. 이 가운데 보안 기업이 운영하던 스캐너 한 대에서는 숨겨진 코드가 실행되면서 기업의 자격증명이 모델이 만든 수집 지점으로 전송됐다. Claude는 이를 이용해 추가 인프라에 접근했다. PyPI의 보안 시스템은 패키지를 자동 삭제했다.

모델은 실행 초기에 실제 인터넷이라면 이런 패키지 배포가 현실의 공격이 된다는 점을 추론 기록에 남겼다. 그러나 낯선 인증기관과 시스템의 2026년 날짜를 근거로 계속 모의 환경이라고 결론 내렸다. 앤트로픽은 실제 PyPI 계정 생성과 악성 패키지 게시로 이어진 모델의 판단을 문제로 보고, 추가 훈련에 반영하겠다고 밝혔다.

사례 3: 내부 연구 모델, 실제 표적임을 확인한 뒤 공격 중단

세 번째 사고에서 아직 출시 계획이 없는 내부 연구 모델은 원래의 가상 표적에 접속하지 못하자 인터넷의 표적 약 9천 개를 스캔했다. 노출된 디버그 페이지에서 자격증명을 읽고 SQL 인젝션을 사용해 한 회사의 인터넷 연결 애플리케이션을 침해했다. 모델은 이후 해당 호스트가 CTF 과제와 무관한 클라우드 계정에 있다는 사실을 확인하고 스스로 공격을 중단했다.

배포용 안전장치 없이 진행된 평가에서 발생

이번 침해 사고들은 일반 사용자에게 제공할 때 고위험 행동을 차단하는 분류기와 모니터링이 활성화되지 않은 상태에서 발생했다. 모델별 안전 훈련은 적용돼 있었지만, 최대 사이버 능력을 측정하기 위해 배포용 안전장치를 끈 만큼 평가 환경의 격리가 마지막 방어선이었다.

앤트로픽은 일반 제공 모델에 붙는 안전장치가 있었다면 이번 행동을 차단했을 것이라고 설명했다. 평가 인프라는 앤트로픽의 민감한 내부 시스템과 고객 데이터에 접근할 수 없는 별도 환경이었다. 모델 자체를 외부로 반출하거나 평가 환경 탈출을 의도한 흔적도 없었다는 것이 회사의 조사 결과다.

모델별 행동 차이는 있었지만 세 사례는 통제된 비교 실험이 아니다. 앤트로픽은 최신 내부 연구 모델만 실제 표적을 인식한 뒤 중단했다는 점이 더 발전한 모델의 상황 판단 개선과 일치한다고 봤다. 동시에 사건 3건만으로 확정할 수는 없다며 독립 평가 기관 METR에 전체 기록 접근과 관련 모델의 표본 검토 권한을 제공해 제3자 검토를 진행하고 있다.

평가 중단 뒤 모니터링과 외부 업체 검증 강화

앤트로픽은 7월 23일 기록 검토를 시작했고 인터넷 접근 가능성이 있는 실행을 발견한 당일 모든 사이버 평가를 중단했다. 다음 날 사고 3건을 모두 확인했으며 7월 27일 Irregular와 피해 조직 세 곳에 알렸다. 연락이 닿은 두 조직은 이전까지 이 활동을 탐지하지 못했고, 앤트로픽은 아직 세 번째 조직과 연락을 시도하고 있다. Irregular도 별도 조사를 진행 중이다.

회사는 평가 전 모든 인터넷 경로를 검증하고 실행 기록과 네트워크 로그를 실시간으로 감시하는 절차를 강화할 계획이다. 평가 기록의 상시 모니터링, 조사 도구 개선과 외부 평가 업체 인프라 검증도 확대한다. Claude Mythos 5가 악성 PyPI 패키지를 만든 실행 기록은 피해 조직을 보호할 수 있도록 일부를 가린 뒤 일주일 안에 공개할 예정이다.

앤트로픽은 이번 사고를 모델이 스스로 별도 목표를 세워 통제를 벗어나는 정렬 실패(alignment failure)가 아니라, 인터넷 차단과 실시간 감시가 작동하지 않은 평가 운영 사고로 설명했다. 모델에게 모의 환경이라고 안내하는 것만으로 실제 인터넷 접속을 막을 수는 없다. 고성능 공격 에이전트를 평가할 때는 운영 시스템과 같은 수준의 네트워크 격리, 최소 권한과 감시를 실제 환경에 적용해야 한다.

원문 출처