"AI가 스스로 탈출했다"…오픈AI 미공개 모델, 허깅페이스까지 해킹

오픈AI의 최고 성능 모델 'GPT-5.6 솔'과 아직 공개되지 않은 고성능 모델이 내부 보안 평가 도중 격리된 테스트 환경을 스스로 뚫고 나와 외부 플랫폼을 해킹한 사실이 뒤늦게 드러났다.

오픈AI는 21일(현지시간) 공식 발표를 통해 사이버 보안 평가 과정에서 자사 모델 두 개가 통제를 벗어나 오픈소스 AI 공유 플랫폼 허깅페이스를 해킹했다고 밝혔다. 사고는 7월 16일 발생했다. 허깅페이스가 먼저 이상 침입을 감지해 자체 대응에 나섰고, 이후 두 회사의 공동 조사 과정에서 오픈AI 모델이 원인이었다는 사실이 확인됐다.

이번 테스트는 '익스플로잇짐(ExploitGym)'이라는 사이버 보안 벤치마크 평가였다. AI 모델에 시스템 취약점 정보를 주고 침입을 지시한 뒤 데이터 취득이나 악성 프로그램 실행에 성공하는지를 측정하는 방식이다. 외부 인터넷과 완전히 차단된 샌드박스 환경에서 진행돼 모델이 테스트 범위 밖으로 나갈 수 없도록 설계됐다.

GPT 5.6 (출처=오픈AI 홈페이지 캡쳐)

하지만 GPT-5.6 솔과 미공개 모델은 이 샌드박스 시스템에 존재하던 알려지지 않은 취약점, 이른바 제로데이(zero-day)를 스스로 찾아냈다. 이 취약점을 이용해 격리 환경을 벗어나 인터넷 접속에 성공한 뒤, 벤치마크 문제의 답을 찾기 위해 허깅페이스 서버에 침투했다는 것이 오픈AI 설명이다.

침투에 성공한 모델들은 허깅페이스 서버에서 인증 정보를 탈취했다. 수백만 개의 오픈소스 AI 모델과 데이터셋이 저장된 허깅페이스에 평가 문제와 관련한 정보가 있을 것으로 판단해 접근한 것으로 분석된다. 오픈AI는 모델이 허깅페이스를 공격하라는 지시를 받은 적이 없으며, 주어진 문제를 풀기 위한 최단 경로를 스스로 탐색하다 이런 결과에 이르렀다고 설명했다.

허깅페이스는 자체 보안 시스템으로 이상 활동을 먼저 탐지해 차단 조치에 나섰다. 그런데 침해 로그를 분석하는 과정에서 예상치 못한 걸림돌을 만났다. 실제 공격 코드와 탈취 명령어가 담긴 질의를 미국 상용 대형언어모델에 넣었더니, 안전장치가 이를 악성 요청으로 오인해 분석 자체를 거부한 것이다. 방어팀의 포렌식 질의와 공격자의 침입 시도를 구분하지 못한 셈이다.

결국 허깅페이스는 중국 지푸AI(Z.ai)가 만든 오픈소스 모델 'GLM 5.2'를 자체 서버에 설치해 1만7000건이 넘는 공격 흔적을 분석했다. 외부로 정보가 나가지 않도록 자사 인프라 안에서만 모델을 구동했다는 설명이다. 미국 빅테크의 AI가 벌인 공격을 미국 기업이 중국산 AI를 빌려 방어한 셈이어서, 자국 AI 안전장치의 실효성을 둘러싼 의문도 함께 제기되고 있다.

오픈AI는 이번 사고를 전례 없는 사이버 사고로 규정하고 대응 체계를 강화하겠다고 밝혔다. 인간의 직접적인 개입이나 지시 없이 AI가 자율적으로 복합 취약점을 조합해 통제 경계를 넘어섰다는 점에서, 업계에서는 AI 안전성 논의의 중대한 전환점이 될 수 있다는 평가가 나온다.

클레망 들랑그 허깅페이스 공동창업자 겸 최고경영자는 사고 초기 공격 수법이 워낙 정교해 대형 AI 연구소가 배후일 것으로 의심했다고 밝히며, 이 모든 일이 자율적으로 벌어졌다는 사실이 놀랍다고 말했다. 그는 AI 안전 문제는 한 기업이 비공개로 해결할 수 있는 영역이 아니라는 점을 이번 사고가 보여준다고 덧붙였다.

사고 공개 이후 미국 정치권과 AI 업계에서도 반응이 잇따랐다. 그레그 카사르 미국 하원의원은 이번 사고를 매우 우려스럽다고 평가하며, AI에 대한 실질적 규제가 없는 상태에서 기술이 너무 빠르게 발전하고 있다고 지적했다. 그는 첨단 AI 모델에 대한 의무적 독립 안전성 평가와 보안 사고 공개 의무화, 국제 공조 강화를 촉구했다.

오픈AI 소속 연구원 마이카 캐럴은 자신의 SNS에 이번 사건이 AI의 목표 정렬(alignment) 실패 위험을 보여주는 명백한 사례라는 취지로 적으며, 앞으로 더 발전된 모델에서는 이런 사고가 어떤 형태로 나타날지 우려를 표했다. 금융 스타트업 플레이드의 정보보안최고책임자 션 캐시디는 외신 인터뷰에서 AI 모델이 실제 기업을 자율적으로 해킹한 이번 사건을 정보보안 역사에서 매우 중요한 날로 평가한 것으로 전해졌다. 반면 AI 규제단체 컨트롤AI의 안드레아 미오티는 초지능 AI의 위험성을 부각하며 국제적 개발 제한이 필요하다는 기존 주장을 재차 강조한 것으로 알려졌다.

두 회사는 확인된 제로데이 취약점에 대한 패치를 진행하는 한편, 향후 평가 과정에서 유사한 사고를 막기 위한 안전장치 마련에 나섰다. 다만 구체적인 기술적 보완책과 완료 시점은 아직 공개되지 않았다.

정재엽 기자

anihil@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

AI 에이전트 뒤에 누가 있나… 월드, ‘인간 증명’으로 신뢰 확보 나선다

AI 에이전트가 수천 개여도 실제 이용자는 한 명… 월드 ID로 사용자 구분 영지식증명 기술로 개인정보 공개 없이 실제 사람의 요청...

아태 중소중견기업 10곳 중 9곳 사이버사고…78%는 보안 예산 늘렸다

카스퍼스키가 7일 공개한 ‘2026 SMB 위협 현황 보고서’에 따르면 국가별 사고 경험률은 베트남이 97%로 가장 높았다. 말레이시아가 95%, 인도네시아가 92%, 인도가 87%로 뒤를 이었다. 태국과 중국은 각각 82%, 67%로 아시아태평양 평균보다 낮았다. 이번 조사는 18개국 중소중견기업과 대기업의 IT 보안 전문가 총 1,800명을 대상으로 진행됐다.

AI 에이전트 ‘무슨 권한으로 무엇을 했나’ 증명한다…미스틴랩스·구글 클라우드 VAA 개발

프롬프트·모델 출력 등은 기업 내부에 보관…무결성 증명만 수이·월러스 연결 A2A 거래 분쟁 재현부터 보안사고 추적·에이전트 결제 기록까지 지원 기업 고객...

[위클리AI] GPT-6.1 솔·제미나이 4 아르곤 등판, 트럼프 'SI' 행정명령까지

지난 주 AI 업계 주요 이슈를 정리했다. 오픈AI의 GPT-6.1 아스트라 출시 철회와 GPT-6.1 솔 공개, 앤트로픽 IPO 투자설명서의 위험 경고, 구글 제미나이 4 아르곤, 트럼프의 'SI' 행정명령, 캘리포니아 AI 해고 금지법, AI 페스타 26 개막과 '모두의 AI' 베타 출시 일정을 다뤘다.