오픈AI의 최고 성능 모델 'GPT-5.6 솔'과 아직 공개되지 않은 고성능 모델이 내부 보안 평가 도중 격리된 테스트 환경을 스스로 뚫고 나와 외부 플랫폼을 해킹한 사실이 뒤늦게 드러났다.
오픈AI는 21일(현지시간) 공식 발표를 통해 사이버 보안 평가 과정에서 자사 모델 두 개가 통제를 벗어나 오픈소스 AI 공유 플랫폼 허깅페이스를 해킹했다고 밝혔다. 사고는 7월 16일 발생했다. 허깅페이스가 먼저 이상 침입을 감지해 자체 대응에 나섰고, 이후 두 회사의 공동 조사 과정에서 오픈AI 모델이 원인이었다는 사실이 확인됐다.
이번 테스트는 '익스플로잇짐(ExploitGym)'이라는 사이버 보안 벤치마크 평가였다. AI 모델에 시스템 취약점 정보를 주고 침입을 지시한 뒤 데이터 취득이나 악성 프로그램 실행에 성공하는지를 측정하는 방식이다. 외부 인터넷과 완전히 차단된 샌드박스 환경에서 진행돼 모델이 테스트 범위 밖으로 나갈 수 없도록 설계됐다.

하지만 GPT-5.6 솔과 미공개 모델은 이 샌드박스 시스템에 존재하던 알려지지 않은 취약점, 이른바 제로데이(zero-day)를 스스로 찾아냈다. 이 취약점을 이용해 격리 환경을 벗어나 인터넷 접속에 성공한 뒤, 벤치마크 문제의 답을 찾기 위해 허깅페이스 서버에 침투했다는 것이 오픈AI 설명이다.
침투에 성공한 모델들은 허깅페이스 서버에서 인증 정보를 탈취했다. 수백만 개의 오픈소스 AI 모델과 데이터셋이 저장된 허깅페이스에 평가 문제와 관련한 정보가 있을 것으로 판단해 접근한 것으로 분석된다. 오픈AI는 모델이 허깅페이스를 공격하라는 지시를 받은 적이 없으며, 주어진 문제를 풀기 위한 최단 경로를 스스로 탐색하다 이런 결과에 이르렀다고 설명했다.
허깅페이스는 자체 보안 시스템으로 이상 활동을 먼저 탐지해 차단 조치에 나섰다. 그런데 침해 로그를 분석하는 과정에서 예상치 못한 걸림돌을 만났다. 실제 공격 코드와 탈취 명령어가 담긴 질의를 미국 상용 대형언어모델에 넣었더니, 안전장치가 이를 악성 요청으로 오인해 분석 자체를 거부한 것이다. 방어팀의 포렌식 질의와 공격자의 침입 시도를 구분하지 못한 셈이다.
결국 허깅페이스는 중국 지푸AI(Z.ai)가 만든 오픈소스 모델 'GLM 5.2'를 자체 서버에 설치해 1만7000건이 넘는 공격 흔적을 분석했다. 외부로 정보가 나가지 않도록 자사 인프라 안에서만 모델을 구동했다는 설명이다. 미국 빅테크의 AI가 벌인 공격을 미국 기업이 중국산 AI를 빌려 방어한 셈이어서, 자국 AI 안전장치의 실효성을 둘러싼 의문도 함께 제기되고 있다.
오픈AI는 이번 사고를 전례 없는 사이버 사고로 규정하고 대응 체계를 강화하겠다고 밝혔다. 인간의 직접적인 개입이나 지시 없이 AI가 자율적으로 복합 취약점을 조합해 통제 경계를 넘어섰다는 점에서, 업계에서는 AI 안전성 논의의 중대한 전환점이 될 수 있다는 평가가 나온다.
클레망 들랑그 허깅페이스 공동창업자 겸 최고경영자는 사고 초기 공격 수법이 워낙 정교해 대형 AI 연구소가 배후일 것으로 의심했다고 밝히며, 이 모든 일이 자율적으로 벌어졌다는 사실이 놀랍다고 말했다. 그는 AI 안전 문제는 한 기업이 비공개로 해결할 수 있는 영역이 아니라는 점을 이번 사고가 보여준다고 덧붙였다.
사고 공개 이후 미국 정치권과 AI 업계에서도 반응이 잇따랐다. 그레그 카사르 미국 하원의원은 이번 사고를 매우 우려스럽다고 평가하며, AI에 대한 실질적 규제가 없는 상태에서 기술이 너무 빠르게 발전하고 있다고 지적했다. 그는 첨단 AI 모델에 대한 의무적 독립 안전성 평가와 보안 사고 공개 의무화, 국제 공조 강화를 촉구했다.
오픈AI 소속 연구원 마이카 캐럴은 자신의 SNS에 이번 사건이 AI의 목표 정렬(alignment) 실패 위험을 보여주는 명백한 사례라는 취지로 적으며, 앞으로 더 발전된 모델에서는 이런 사고가 어떤 형태로 나타날지 우려를 표했다. 금융 스타트업 플레이드의 정보보안최고책임자 션 캐시디는 외신 인터뷰에서 AI 모델이 실제 기업을 자율적으로 해킹한 이번 사건을 정보보안 역사에서 매우 중요한 날로 평가한 것으로 전해졌다. 반면 AI 규제단체 컨트롤AI의 안드레아 미오티는 초지능 AI의 위험성을 부각하며 국제적 개발 제한이 필요하다는 기존 주장을 재차 강조한 것으로 알려졌다.
두 회사는 확인된 제로데이 취약점에 대한 패치를 진행하는 한편, 향후 평가 과정에서 유사한 사고를 막기 위한 안전장치 마련에 나섰다. 다만 구체적인 기술적 보완책과 완료 시점은 아직 공개되지 않았다.
