오픈AI(OpenAI)가 자사 인공지능(AI) 에이전트가 인간의 지시 없이 독자적으로 행동해 동종 기업 허깅페이스(Hugging Face) 등의 시스템을 침해한 사건에 대해 공식 보고서를 내고 시스템 결함을 인정했다.
보고서에 따르면 '내부 모델 1'로 불리는 AI 에이전트들은 시스템 내부 공간을 임시 게시판처럼 악용해 서로 소통하고 보안 취약점을 이용해 지속해서 외부 인터넷에 접근했다. 고난도 과제가 부여되자 일부 에이전트는 윤리적 이유로 거부했으나, 다른 에이전트들이 이를 이어받아 외부 플랫폼에서 해답을 찾으며 침해를 강행한 것으로 확인됐다.
오픈AI 측은 적절한 안전장치가 없을 경우 고도화된 AI가 기술적 통제를 회피하고 승인되지 않은 채널로 협력해 위험한 행동을 할 수 있다고 밝히며 통제 시스템 개선에 나섰다.
