"AI가 스스로 탈출했다"…오픈AI 미공개 모델, 허깅페이스까지 해킹

오픈AI의 최고 성능 모델 'GPT-5.6 솔'과 아직 공개되지 않은 고성능 모델이 내부 보안 평가 도중 격리된 테스트 환경을 스스로 뚫고 나와 외부 플랫폼을 해킹한 사실이 뒤늦게 드러났다.

오픈AI는 21일(현지시간) 공식 발표를 통해 사이버 보안 평가 과정에서 자사 모델 두 개가 통제를 벗어나 오픈소스 AI 공유 플랫폼 허깅페이스를 해킹했다고 밝혔다. 사고는 7월 16일 발생했다. 허깅페이스가 먼저 이상 침입을 감지해 자체 대응에 나섰고, 이후 두 회사의 공동 조사 과정에서 오픈AI 모델이 원인이었다는 사실이 확인됐다.

이번 테스트는 '익스플로잇짐(ExploitGym)'이라는 사이버 보안 벤치마크 평가였다. AI 모델에 시스템 취약점 정보를 주고 침입을 지시한 뒤 데이터 취득이나 악성 프로그램 실행에 성공하는지를 측정하는 방식이다. 외부 인터넷과 완전히 차단된 샌드박스 환경에서 진행돼 모델이 테스트 범위 밖으로 나갈 수 없도록 설계됐다.

GPT 5.6 (출처=오픈AI 홈페이지 캡쳐)

하지만 GPT-5.6 솔과 미공개 모델은 이 샌드박스 시스템에 존재하던 알려지지 않은 취약점, 이른바 제로데이(zero-day)를 스스로 찾아냈다. 이 취약점을 이용해 격리 환경을 벗어나 인터넷 접속에 성공한 뒤, 벤치마크 문제의 답을 찾기 위해 허깅페이스 서버에 침투했다는 것이 오픈AI 설명이다.

침투에 성공한 모델들은 허깅페이스 서버에서 인증 정보를 탈취했다. 수백만 개의 오픈소스 AI 모델과 데이터셋이 저장된 허깅페이스에 평가 문제와 관련한 정보가 있을 것으로 판단해 접근한 것으로 분석된다. 오픈AI는 모델이 허깅페이스를 공격하라는 지시를 받은 적이 없으며, 주어진 문제를 풀기 위한 최단 경로를 스스로 탐색하다 이런 결과에 이르렀다고 설명했다.

허깅페이스는 자체 보안 시스템으로 이상 활동을 먼저 탐지해 차단 조치에 나섰다. 그런데 침해 로그를 분석하는 과정에서 예상치 못한 걸림돌을 만났다. 실제 공격 코드와 탈취 명령어가 담긴 질의를 미국 상용 대형언어모델에 넣었더니, 안전장치가 이를 악성 요청으로 오인해 분석 자체를 거부한 것이다. 방어팀의 포렌식 질의와 공격자의 침입 시도를 구분하지 못한 셈이다.

결국 허깅페이스는 중국 지푸AI(Z.ai)가 만든 오픈소스 모델 'GLM 5.2'를 자체 서버에 설치해 1만7000건이 넘는 공격 흔적을 분석했다. 외부로 정보가 나가지 않도록 자사 인프라 안에서만 모델을 구동했다는 설명이다. 미국 빅테크의 AI가 벌인 공격을 미국 기업이 중국산 AI를 빌려 방어한 셈이어서, 자국 AI 안전장치의 실효성을 둘러싼 의문도 함께 제기되고 있다.

오픈AI는 이번 사고를 전례 없는 사이버 사고로 규정하고 대응 체계를 강화하겠다고 밝혔다. 인간의 직접적인 개입이나 지시 없이 AI가 자율적으로 복합 취약점을 조합해 통제 경계를 넘어섰다는 점에서, 업계에서는 AI 안전성 논의의 중대한 전환점이 될 수 있다는 평가가 나온다.

클레망 들랑그 허깅페이스 공동창업자 겸 최고경영자는 사고 초기 공격 수법이 워낙 정교해 대형 AI 연구소가 배후일 것으로 의심했다고 밝히며, 이 모든 일이 자율적으로 벌어졌다는 사실이 놀랍다고 말했다. 그는 AI 안전 문제는 한 기업이 비공개로 해결할 수 있는 영역이 아니라는 점을 이번 사고가 보여준다고 덧붙였다.

사고 공개 이후 미국 정치권과 AI 업계에서도 반응이 잇따랐다. 그레그 카사르 미국 하원의원은 이번 사고를 매우 우려스럽다고 평가하며, AI에 대한 실질적 규제가 없는 상태에서 기술이 너무 빠르게 발전하고 있다고 지적했다. 그는 첨단 AI 모델에 대한 의무적 독립 안전성 평가와 보안 사고 공개 의무화, 국제 공조 강화를 촉구했다.

오픈AI 소속 연구원 마이카 캐럴은 자신의 SNS에 이번 사건이 AI의 목표 정렬(alignment) 실패 위험을 보여주는 명백한 사례라는 취지로 적으며, 앞으로 더 발전된 모델에서는 이런 사고가 어떤 형태로 나타날지 우려를 표했다. 금융 스타트업 플레이드의 정보보안최고책임자 션 캐시디는 외신 인터뷰에서 AI 모델이 실제 기업을 자율적으로 해킹한 이번 사건을 정보보안 역사에서 매우 중요한 날로 평가한 것으로 전해졌다. 반면 AI 규제단체 컨트롤AI의 안드레아 미오티는 초지능 AI의 위험성을 부각하며 국제적 개발 제한이 필요하다는 기존 주장을 재차 강조한 것으로 알려졌다.

두 회사는 확인된 제로데이 취약점에 대한 패치를 진행하는 한편, 향후 평가 과정에서 유사한 사고를 막기 위한 안전장치 마련에 나섰다. 다만 구체적인 기술적 보완책과 완료 시점은 아직 공개되지 않았다.

정재엽 기자

anihil@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

SDT, 연말 6큐비트 실리콘 스핀 양자컴 시연…멀티 플랫폼 전략 넓힌다

자기술 전문기업 SDT가 초전도체와 이온트랩에 이어 실리콘 스핀 방식으로 양자컴퓨터 제조 영역을 넓힌다. 서울대학교, 글로벌 양자 하드웨어 기업 세미콘(SemiQon)과 함께 연말까지 6큐비트 실리콘 스핀 양자컴퓨터를 시연하고, 서로 다른 양자처리장치(QPU)를 지원할 수 있는 시스템 통합 역량을 강화한다는 구상이다.

오픈AI, '치명적' 해킹 능력 첫 탑재한 GPT-6 아스트라 출시…"AGI 시대 열렸다"

오픈AI가 사이버보안 위험 등급 '치명적'에 처음 도달한 GPT-6 아스트라를 출시했다. AGI 도달 논쟁부터 국내 망분리 규제 이슈, 앤스로픽·구글의 대응 전략까지 짚어봤다.

[현장] 엔비디아 ‘알파마요’ 이끄는 마르코 파보네가 말하는 ‘판단 이유까지 말하는 자율주행 AI’는?

스탠퍼드대학교 항공우주공학과 부교수이자 엔비디아에서 자율주행차 연구를 이끄는 파보네 박사는 이날 ‘피지컬 AI를 위한 추론 모델’을 주제로 파운데이션 모델(Foundation Model)과 추론 모델(Reasoning Model)이 자율주행 개발 방식을 어떻게 바꾸고 있는지를 설명했다. 그의 발표를 관통한 화두는 엔비디아의 비전·언어·행동(Vision-Language-Action, VLA) 모델 ‘알파마요(Alpamayo)’였다.

[현장] 공격 전에 뚫어보고, AI가 탐지 룰 만든다…파고네트웍스가 그린 ‘SOC의 미래’

AI로 무장한 공격자가 기업이 취약점을 발견하고 잘못된 보안 설정을 바로잡기 전에 먼저 침투할 수 있게 되면서 기존 보안 운영의 전제도 달라졌다. 이날 권영목 대표는 ‘SOC as a Service-MDR을 기반으로 확장하는 보안 운영의 미래’를 주제로 파고네트웍스의 전략을 공개했다.