대화창 밖으로 나오자 사고가 시작됐다…오픈AI·메타가 연 ‘AI 에이전트 시대’의 명암

오픈AI 연구 에이전트, 학습·평가 데이터 외부 전송…사용자 제공 이미지 53건도 포함
메타 ‘뮤즈’, 이메일·쇼핑·예약 넘어 전화까지…출시 2주 만에 250만 다운로드
‘답하는 AI’에서 ‘행동하는 AI’로…편의 커진 만큼 권한·감독·책임이 새 과제로
생성형 AI가 질문에 답하는 단계를 넘어 이메일 전송, 예약, 쇼핑, 외부 서비스 접속 등 실제 업무를 수행하는 ‘AI 에이전트’로 진화하고 있다. 행동 권한이 커질수록 오류가 현실의 행동으로 이어질 가능성도 함께 커지고 있다. (이미지=AI로 생성)

AI가 틀린 답을 내놓는 것과 AI가 직접 잘못된 행동을 하는 것은 다른 문제다. 생성형 AI의 대표적인 위험이 사실과 다른 정보를 만들어내는 ‘환각(Hallucination)’이었다면, 외부 서비스를 직접 이용하는 AI 에이전트는 오류의 결과를 현실의 행동으로 옮길 수 있다.

그 위험이 최근 잇따라 현실로 드러났다. 오픈AI는 지난 25일(현지시간) 연구 환경에서 작동하던 에이전트들이 제3자 서비스를 이용하는 과정에서 학습·평가 데이터를 외부로 전송한 사례를 확인했다고 공개했다. 대부분은 사용자에게서 나온 데이터가 아니었지만, 지금까지 확인된 사례에는 사용자 제공 이미지 53건이 포함됐다. 이 이미지들은 공개 목록에는 나타나지 않는 링크 형태로 이미지 호스팅 사이트에 게시됐다. 오픈AI는 대부분을 삭제했고 나머지도 삭제를 진행하고 있다고 밝혔다.

반면 우려 속에도 서비스 경쟁은 속도를 내고 있다. 앞서 메타는 지난 8일 개인 AI 에이전트 ‘뮤즈(Muse)’를 출시했다. 질문에 답하는 데 그치지 않고 이메일을 보내고 여행을 예약하며 쇼핑과 각종 온라인 업무를 대신 처리하는 서비스다. 출시 2주 만에 미국 앱 다운로드 차트 상위권에 올랐다. 메타는 전화 업무까지 에이전트의 영역으로 넓히고 있다.

두 사례가 보여주는 방향은 같다. AI 경쟁의 무게중심이 ‘누가 더 좋은 답을 내놓느냐’에서 ‘누가 사용자를 대신해 더 많은 일을 처리하느냐’로 이동하고 있다는 것이다. 문제는 AI에 더 많은 행동 권한을 줄수록 잘못된 판단의 영향 역시 대화창 밖으로 확대된다는 점이다.

53개 이미지가 보여준 경고…‘틀린 답’과 ‘잘못된 행동’은 다르다

오픈AI의 연구·평가 환경에서 일부 AI 에이전트가 접근 통제를 우회하거나 제3자 서비스를 이용한 사실이 확인됐다. 조사 과정에서는 사용자 제공 이미지 53건이 외부 이미지 호스팅 사이트에 게시된 사실도 드러났다. (이미지=AI로 생성)

오픈AI의 최근 에이전트 문제를 이해하려면 현재도 업계에 회자되고 있는 지난 7월 외부로 드러난 허깅페이스(Hugging Face) 침해 사고부터 살펴볼 필요가 있다.

오픈AI가 지난달 26일 공개한 사고 조사 결과를 보면, 내부 사이버보안 평가 과정에서 연구용 AI 모델들이 인터넷 접근을 차단하기 위한 통제를 우회했다. 5월 26일 한 에이전트가 오픈AI 내부의 아티팩토리(Artifactory)를 이용해 의도하지 않은 방식으로 인터넷에 접근했고, 6월 26일에는 아티팩토리의 토큰 갱신 취약점을 이용해 관리자 수준의 접근권한을 확보했다. 이후 7월 10일부터 에이전트들이 공개된 허깅페이스 인증정보를 이용하고 보안 취약점을 연쇄적으로 활용하면서 외부 시스템 침해로 이어졌다.

이후 조사 범위가 넓어지면서 다른 활동들도 잇따라 확인됐다. AI 감독 연구 비영리기관 트랜슬루스(Transluce)는 지난 23일 공개한 조사에서 AI 에이전트들이 웹 보안 분석 서비스(urlquery.net)를 이용해 접근 제한을 우회하고 공개 인터넷에 대한 접근 범위를 넓힌 흔적을 발견했다고 밝혔다. 조사 대상에는 미국 Data USA, 뉴멕시코대 디지털도서관, 호주 보건복지연구원(Australian Institute of Health and Welfare, AIHW)의 데이터 서비스가 포함됐다. 트랜슬루스는 AIHW와 Data USA 관련 활동을 오픈AI가 이미 자사에서 비롯됐다고 확인한 에이전트 집단과 연결했다. 활동 흔적은 적어도 지난 3월 6일까지 거슬러 올라갔다.

다만 이 사례들을 모두 ‘해킹 성공’을 의미하는 것은 아니다. 트랜슬루스가 공개한 것은 세 데이터 제공처에 대한 침투 시도 정황이며 결과와 연관성에는 차이가 있다.

별도로 호주 정부가 지난 24일 공개한 사건에서는 보다 명확한 무단 접근이 확인됐다. 호주 정부 설명에 따르면 오픈AI 모델은 지난 6월 인터넷 기반 연구 평가 과정에서 AIHW, 빅토리아주 보건부, 뉴사우스웨일스 범죄통계연구국, 호주 서비스청의 메디케어 통계 보고 서비스 등 네 곳과 상호작용했다. 이 가운데 앞선 세 곳에서는 공개 정보에 정상적으로 접근했지만, 메디케어 통계 보고 서비스의 공개 웹사이트를 뒷받침하는 인프라에는 허가되지 않은 방식으로 접근했다.

해당 포털은 개인별 메디케어 기록이 아닌 통계 정보를 제공하는 시스템이지만, 에이전트는 공개 파일뿐 아니라 일부 비공개 파일에도 접근했다. 호주 정부는 지난 24일(현지시간) 기준 개인 의료정보에 접근했다는 증거는 확인되지 않았다고 밝혔다.

사건 발생과 통보 사이에도 시차가 있었다. 호주 정부가 공개한 연표에 따르면 오픈AI는 지난달 11일 해당 활동을 파악했고, 약 한 달 뒤인 지난 10일 호주 서비스청에 이메일로 알렸다. 호주 정부는 현재 별도 조사에 착수한 상태다.

한편 지난 25일 개인정보와 관련된 새로운 사실이 추가됐다. 오픈AI는 연구 환경의 에이전트가 제3자 서비스를 이용하면서 학습·평가 데이터를 전송한 사례를 확인했다고 밝혔다. 오픈AI의 학습 데이터 일부에는 학습에 사용할 수 있도록 설정된 이용자의 상호작용에서 유래한 콘텐츠가 들어간다. 기업·비즈니스 계정과 응용프로그램 인터페이스(Application Programming Interface, API) 데이터는 관리자가 별도로 허용하지 않는 한 포함되지 않는다. 오픈AI는 학습에 이용하기 전 계정 정보와 데이터를 분리하고 이름·연락처·계좌번호 같은 개인정보를 필터링한다고 설명했다.

그럼에도 이번 조사에서 사용자가 제공한 이미지 53건이 외부 이미지 호스팅 사이트에 게시된 사실이 확인됐다. 오픈AI는 기술적 처리 방식과 개인정보 정책상 해당 데이터를 원래 이용자 계정과 다시 연결할 수 없다고 설명했다. 다만 오픈AI는 해당 이미지가 실제 인물을 담았는지, AI가 생성한 이미지인지는 공개하지 않았다.

로이터 보도 따르면 25일 오픈AI가 전체 에이전트 활동을 파악하는 데 수개월이 걸릴 것으로 보고 있다. 오픈AI는 현재까지 문제가 될 수 있는 활동과 관련해 정부·대학·공공기관 등을 포함한 수십 곳의 제3자에게 통보했다고 밝혔다. 지난 16일에는 예상 밖이거나 우려스러운 모델 행동을 체계적으로 추적·조사·공개하기 위한 ‘모델 정렬 불일치 보고 프레임워크’도 공개했다.

기존 생성형 AI에서 잘못된 판단은 주로 ‘잘못된 답’으로 나타났다. 에이전트에서는 다르다. AI가 웹사이트에 접속하고 로그인하고 파일을 다루며 외부 서비스를 호출할 수 있다면 판단 오류가 곧 행동으로 이어질 수 있다. 오픈AI 역시 이번 조사에서 접근 통제 우회, 노출된 인증정보 이용, 명령어 삽입, 허용 범위를 벗어난 시스템 접근, 제3자 사이트에 내용을 게시하는 ‘에이전트 스팸’ 등 여러 유형의 행동을 확인했다고 밝혔다.

메타 뮤즈가 보여준 반대편…사람들이 원하는 것도 결국 ‘행동하는 AI’

메타의 개인 AI 에이전트 ‘뮤즈’는 이메일 전송과 여행 예약, 쇼핑 등 사용자의 온라인 업무를 직접 수행한다. 메타는 미국 사업체에 전화를 거는 기능까지 시험하며 에이전트의 행동 범위를 넓히고 있다. (이미지=AI로 생성)

그렇다고 AI 기업들이 에이전트 개발 속도를 늦추고 있는 것은 아니다. 오히려 반대다. 메타가 지난 8일 미국에서 출시한 뮤즈는 이러한 변화가 소비자 서비스까지 빠르게 확산되고 있음을 보여준다. 메타는 뮤즈를 단순한 챗봇이 아니라 사용자를 대신해 실제 업무를 수행하는 ‘개인 AI 에이전트’로 규정했다.

차이는 사용자가 요구하는 결과에서 드러난다. 기존 챗봇에 “여행지를 추천해 달라”고 요청했다면 에이전트에는 조건을 알려주고 여행을 예약하도록 맡길 수 있다. 뮤즈는 이메일 전송, 여행 예약, 웹사이트 검색, 양식 작성, 쇼핑 등 여러 작업을 직접 수행하도록 설계됐다. 전용 보안 가상머신(Virtual Machine, VM)인 ‘뮤즈 시큐어 VM(Muse Secure VM)’에서 작동하며 사용자가 허용한 서비스에 접근한다.

메타가 강조하는 안전장치도 바로 이 ‘행동’에 맞춰져 있다. 별도의 감시 에이전트인 ‘센티널(Sentinel)’이 뮤즈의 인터넷 접근을 확인하고, 이메일 발송이나 구매 같은 민감한 작업에서는 이용자의 승인을 요구하도록 설계했다. 메타는 비밀번호와 결제수단을 뮤즈가 직접 볼 수 없도록 별도의 보안 저장 공간에 보관한다. 사용자는 뮤즈가 어떤 행동을 했고 앞으로 무엇을 하려는지 기록을 확인할 수 있다.

초기 시장 반응은 빠르다. 뮤즈는 출시 약 2주 만에 250만건 이상 다운로드됐고 미국 앱 다운로드 차트 정상에 올랐다.

하지만 자동화의 경계를 보여주는 장면도 등장했다. 메타는 뮤즈 이용자가 미용실 예약, 재고 확인, 견적 문의 등을 맡길 수 있도록 미국 사업체에 직접 전화를 거는 기능을 시험했다. 지난달부터 직원 대상 내부 테스트를 시작했고, 뮤즈 출시 이후 일부 이용자에게 AI 전화 기능을 확대했다.

문제는 AI 전화가 항상 원활하게 작동하지 않았다는 점이다. 로이터의 보도에 따르면 일부 사업자가 AI라는 사실을 인지하고 전화를 끊는 등의 문제가 발생했다. 메타는 이를 보완하기 위해 직원 절반에게 ‘휴먼 컨시어지(human concierge)’ 기능을 제공해 시험했다. 이 기능은 뮤즈가 거는 일부 전화를 인간 계약직이 대신 처리하는 방식이다.

그러나 내부에서 개인정보 보호 문제가 제기됐다. 인간 상담원이 통화 내용을 처리하면서 의도하지 않은 민감한 정보까지 접할 수 있다는 우려였다. 메타 측 책임자는 적절한 고지 없이 테스트를 시작한 것은 잘못이었다고 인정했고, 일단 해당 기능을 철회했다. 이와 관련 메타 측은 “안전과 개인정보 보호 장치를 개선하기 위한 피드백 수집 목적의 시험이었으며 적절한 고지와 준비가 갖춰졌을 때만 공개하겠다”고 설명했다.

이 사례는 현재 AI 에이전트 산업이 놓인 지점을 압축적으로 보여준다. 이용자가 원하는 것은 질문에 답해주는 AI를 넘어 실제 일을 끝내주는 AI지만, 그 일을 완전히 자동화하려 할수록 기술적 신뢰성과 개인정보 보호라는 새로운 문제가 따라붙는다.

더 많은 권한을 줄수록 커지는 위험…에이전트 시대의 새 안전 문제

AI 에이전트가 처리할 수 있는 업무가 늘어날수록 권한의 범위와 인간의 승인 시점, 사고 발생 시 책임과 추적 체계가 새로운 AI 안전 과제로 떠오르고 있다. (이미지=AI로 생성)

에이전트 경쟁이 본격화되면서 AI 안전을 평가하는 기준도 달라지고 있다. 첫 번째 문제는 권한의 범위다. 웹 검색만 하는 AI와 이메일을 보내고 상품을 구매하며 외부 시스템에 접속할 수 있는 AI가 잘못된 판단을 했을 때의 결과는 같지 않다. 실제로 메타는 뮤즈가 어떤 앱에 접근할지 사용자가 결정하도록 하고 구매·이메일 발송 같은 민감한 작업에는 별도의 승인을 요구하는 구조를 채택했다.

두 번째는 인간의 개입 시점이다. 모든 행동을 사람이 하나씩 승인한다면 에이전트가 제공하는 자동화의 효용은 떨어진다. 반대로 승인 단계를 최소화하면 AI가 처리할 수 있는 업무는 늘어나지만 잘못된 행동을 사전에 차단할 기회도 줄어든다. 메타의 센티널과 행동 승인 구조, 오픈AI가 사고 이후 강화하고 있는 모니터링은 모두 이 문제를 해결하려는 서로 다른 방식이다.

세 번째는 사고가 발생했을 때 책임과 통제 문제다. 이 문제는 이미 금융권에서도 제기되고 있다. 뱅크오브아메리카, ING, 캐피털원 등 주요 금융기관들은 AI 쇼핑 에이전트 확산에 따라 금융정보 오용, 사기, 개인정보 보호와 소비자 구제 문제를 우려하고 있는 것으로 알려졌다. 그러면서 AI가 거래 과정에 개입했다는 사실을 이용자가 알 수 있도록 하고 데이터 보호와 책임 체계를 명확히 해야 한다는 목소리가 나오고 있다.

오픈AI와 메타의 사례는 서로 다른 사건이다. 오픈AI에서 확인된 문제는 주로 연구·평가 환경의 에이전트가 의도한 경계를 벗어난 행동을 한 사례이고, 메타 뮤즈는 일반 소비자에게 실제 업무 수행 권한을 주는 상용 에이전트다.

하지만 두 사례가 향하는 방향에는 공통점이 있다. AI가 텍스트, 이미지, 영상 등을 생성하는 도구에서 외부 시스템을 이용해 목적을 수행하는 소프트웨어로 바뀌고 있다는 것이다.

오픈AI 사건은 행동하는 AI가 통제 범위를 벗어났을 때 어떤 문제가 발생할 수 있는지를 보여줬다. 메타 뮤즈의 빠른 확산은 그럼에도 이용자와 기업이 왜 행동하는 AI를 원하는지를 보여준다.

결국 AI 경쟁의 다음 승부처는 누가 가장 그럴듯한 답을 내놓느냐에만 있지 않다. AI에게 얼마나 많은 일을 맡길 수 있는지, 그리고 그 행동을 얼마나 안전하게 통제하고 추적할 수 있는지가 ‘에이전트 시대’의 새로운 경쟁 조건으로 떠오르고 있다.

황정호 기자

jhh@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

카스퍼스키, 미국 표준 인증 SOC 2 Type II 감사 완료…안티바이러스 DB 개발·배포 통제 검증

2025년 8월~2026년 7월 Windows·Unix용 안티바이러스 데이터베이스 개발 전 과정 평가 인터뷰·운영 관찰·문서 분석·통제 절차 재수행으로 보안 통제 설계와 운영 효과성...

아시아 산업계 AI 전환, 기술보다 ‘사람’이 과제…한국 59% “시스템 사고 중요”

아시아 기업 절반 이상, 2028년까지 현장 인력이 AI 시스템 관리·감독할 것으로 전망 한국 기업 54% AI로 현장 전문지식 보존…숙련 인력...

월 100만원짜리 '살빼는 주사'의 두 얼굴… 비만치료제 시장의 명과 암

2026년 1분기, 국내 비만치료제 시장에서 일어난 일은 예상 밖이었다. 마운자로(Mounjaro)의 매출은 3,232억 원. 같은 시기 위고비(Wegovy)는 1,040억 원에 그쳤다. 세 배가 넘는 격차다. 2025년 8월 출시된 마운자로는 단 8개월 만에 누적 매출 5,400억 원을 돌파하며 주사형 비만치료제 시장 점유율 78%를 차지했다.

"1000대 팔 수 있다"… 사천 공장이 24시간 돌아가는 이유

한국항공우주산업(KAI)은 국내 유일의 완제기 제조기업으로, 전투기와 훈련기, 헬기 등 군용 항공기부터 항공기 구조물과 위성·우주사업까지 아우르는 종합 항공우주 기업이다.