팔로알토 네트웍스, 딥시크에서 보안 취약점 발견…“AI에 특화된 보안 솔루션 필요”

글로벌 사이버보안 기업인 팔로알토 네트웍스(Palo Alto Networks)는 자사 위협 연구 기관 ‘유닛42(Unit42)’의 조사를 바탕으로 딥시크가 ‘탈옥(jailbreaking)’ 공격에 취약하며, 전문 지식이나 경험이 없는 사용자도 악성 콘텐츠를 생성할 수 있다는 결과를 17일 밝혔다.

팔로알토 네트웍스의 유닛42 연구진은 딥시크가 악성 소프트웨어 생성, 악의적인 스크립팅 등 유해한 콘텐츠를 생성할 수 있는 가능성을 우려하여 총 세 가지 탈옥 기법을 통해 취약점을 집중적으로 테스트했다.

팔로알토 네트웍스에 따르면 이번 연구는 ‘디셉티브 딜라이트(Deceptive Delight)’, ‘배드 리커트 저지(Bad Likert Judge)’, ‘크레셴도(Crescendo)’ 등의 단일 또는 다단계 탈옥 기법이 활용됐다. 이 기법은 딥시크의 가드레일을 성공적으로 우회(bypass)해 데이터 탈취 도구 개발, 키로거(keylogger) 생성, 발화 장치 제작 등과 관련된 유해한 콘텐츠를 생성했다.

탈옥은 AI 모델에 내장된 가드레일을 우회해 AI가 유해한 콘텐츠를 생성하거나 부적절한 답변 등을 출력하도록 유도하는 행위를 의미한다. 이를 통해 누구나 허위 정보 또는 조작된 콘텐츠를 확산하거나 범죄 행위 등에 악용할 수 있다.

유닛42 측은 “연구 과정에서 딥시크의 초기 응답은 대체적으로 무해했으나 정교하게 설계된 프롬프트를 단계적으로 입력했을 때 높은 우회 및 탈옥 성공률을 보이며 딥시크의 보안 취약점이 드러났다”며 “이번 연구에 활용된 세 가지 탈옥 기법이 성공적으로 작동한 것은 아직 발견되지 않은 다른 새로운 탈옥 기법들이 있을 수 있음을 시사한다”고 언급했다.

이어 “특정 LLM에 대한 모든 탈옥 기법을 완벽히 차단하는 것은 어려울 수 있지만, 기업의 LLM 활용에 있어서 적절한 가이드라인 설정 및 승인되지 않은 제3자 LLM 활용에 대한 모니터링 강화 등의 보안 대책이 필요하다”고 강조했다.

이와 관련, 팔로알토 네트웍스는 프리시전 AI(Precision AI) 기반 보안 솔루션 포트폴리오를 통해 기업이 생성형 AI 애플리케이션 사용으로 인한 위험을 차단하는 동시에 AI 혁신을 가속화할 수 있도록 지원한다. 또한, 유닛42가 제공하는 AI 보안 평가를 통해 기업은 보안을 강화하고 비즈니스 생산성을 향상시킬 수 있다.

팔로알토 네트웍스는 이번 유닛42의 연구 결과를 ‘사이버위협연합(CTA, Cyber Threat Alliance)’ 회원사들과 공유했다. 또한, 향후에도 기업들이 신속한 보안 조치를 적용하고 사이버 범죄 피해를 체계적으로 방지할 수 있도록 지원할 예정이다.

필리파 콕스웰(Philippa Cogswell) 팔로알토 네트웍스 유닛42 일본·아시아·태평양(JAPAC) 부사장 겸 매니징 파트너는 “기업들이 LLM 모델을 적극 활용하는 것과 동시에, 사이버 공격자들도 이를 악용해 공격의 속도, 규모, 정교함을 높일 가능성이 크다”며 “이미 국가 지원 해커들이 오픈AI와 제미나이를 활용해 공격을 수행하고, 피싱 기법을 정교화하며, 악성코드를 개발하는 사례가 확인됐다”고 전했다. 이어 “향후 공격자들은 AI 및 LLM 기술을 더욱 정교하게 발전시키고, 궁극적으로 AI 기반 공격 에이전트까지 개발할 것으로 예상된다”는 경고를 덧붙였다.

김광우 기자

kimnoba@tech42.co.kr
기자의 다른 기사보기
저작권자 © Tech42 - Tech Journalism by AI 테크42 무단전재 및 재배포 금지

관련 기사

AI 에이전트 뒤에 누가 있나… 월드, ‘인간 증명’으로 신뢰 확보 나선다

AI 에이전트가 수천 개여도 실제 이용자는 한 명… 월드 ID로 사용자 구분 영지식증명 기술로 개인정보 공개 없이 실제 사람의 요청...

아태 중소중견기업 10곳 중 9곳 사이버사고…78%는 보안 예산 늘렸다

카스퍼스키가 7일 공개한 ‘2026 SMB 위협 현황 보고서’에 따르면 국가별 사고 경험률은 베트남이 97%로 가장 높았다. 말레이시아가 95%, 인도네시아가 92%, 인도가 87%로 뒤를 이었다. 태국과 중국은 각각 82%, 67%로 아시아태평양 평균보다 낮았다. 이번 조사는 18개국 중소중견기업과 대기업의 IT 보안 전문가 총 1,800명을 대상으로 진행됐다.

AI 에이전트 ‘무슨 권한으로 무엇을 했나’ 증명한다…미스틴랩스·구글 클라우드 VAA 개발

프롬프트·모델 출력 등은 기업 내부에 보관…무결성 증명만 수이·월러스 연결 A2A 거래 분쟁 재현부터 보안사고 추적·에이전트 결제 기록까지 지원 기업 고객...

[위클리AI] GPT-6.1 솔·제미나이 4 아르곤 등판, 트럼프 'SI' 행정명령까지

지난 주 AI 업계 주요 이슈를 정리했다. 오픈AI의 GPT-6.1 아스트라 출시 철회와 GPT-6.1 솔 공개, 앤트로픽 IPO 투자설명서의 위험 경고, 구글 제미나이 4 아르곤, 트럼프의 'SI' 행정명령, 캘리포니아 AI 해고 금지법, AI 페스타 26 개막과 '모두의 AI' 베타 출시 일정을 다뤘다.