‘AI 사이버공격’ 현실 됐다…인간 통제 뚫은 GPT, 멋대로 해킹
윤예림 기자
입력 2026 07 22 14:22
수정 2026 07 22 17:59
오픈AI의 최신 인공지능(AI) 모델들이 통제된 실험 환경을 벗어나 외부 사이트를 해킹하는 초유의 사고가 발생했다. 인간의 통제를 벗어난 AI의 사이버 공격이 현실화된 첫 사례다.
21일(현지시간) 오픈AI는 ‘GPT-5.6 솔’과 일부 미공개 AI 모델이 내부 평가 도중 통제를 벗어나 개방형(오픈소스) AI 공유 플랫폼 ‘허깅페이스’를 해킹한 사실을 확인했다고 밝혔다.
허깅페이스는 AI 개발자들이 함께 쓰는 거대한 ‘AI 자료창고’로, 개발자들은 이곳에서 AI 모델과 데이터를 공유하고 서로의 성과를 바탕으로 새로운 AI를 개발한다.
이번 사고는 AI 모델의 취약점 탐지 및 공격 능력을 측정하는 내부 실험 과정에서 발생했다. 당시 오픈AI 모델들은 평가를 위해 사이버 공격에 대한 안전장치가 일부 완화된 상태였다.
오픈AI는 이들 모델의 사이버 공격 능력을 평가하기 위해 외부 인터넷과 격리된 ‘샌드박스’ 환경에서 시험을 진행했으나, AI 모델들은 미공개(제로데이) 취약점을 이용해 통제망을 뚫고 인터넷에 접속했다고 설명했다.
이후 허깅페이스에 접속해 인증 정보를 탈취하고 해당 서버를 해킹한 것으로 나타났다.
오픈AI는 자사 모델들이 이같이 행동한 이유에 대해 “모든 정황을 종합해 볼 때 이 모델들은 (보안 벤치마크인) ‘익스플로잇짐’의 평가용 문제에 대한 해법을 찾는 데 지나치게 집중해 극단적인 수단까지 동원했던 것으로 보인다”고 분석했다.
앞서 허깅페이스는 지난 16일 자사 서버가 자율 AI 에이전트에 의해 해킹됐으며 공격자가 어떤 모델을 사용했는지는 확인되지 않았다고 공지한 바 있다. 해당 사건의 범인이 오픈AI의 모델들로 드러난 셈이다.
허깅페이스는 이와 같은 해킹 사실을 AI 지원 탐지 시스템의 발견으로 인지했고, 공격 양상의 분석도 AI로 진행했다.
회사는 “일반에 공개된 사용자 대상 모델이나 데이터세트 등이 변조된 흔적은 발견되지 않았고, 소프트웨어 공급망도 안전한 것으로 확인됐다”고 말했다.
허깅페이스와 오픈AI는 현재 공동으로 포렌식(디지털 증거 분석) 조사를 진행해 관련 취약점을 보완하고 있다.
오픈AI는 “이번 사건은 최첨단 기법이 동원된 전례 없는 사이버 공격으로 간주하고 있다”며 “현재 허깅페이스와 사건 전말의 이해와 모델의 대응 능력을 가늠하기 위해 초기 조사 결과를 조사 중”이라고 밝혔다.
그러면서 “허깅페이스와 조사를 계속 진행해 조사가 완료되는 대로 취약점 및 자세한 조사 정보를 공개할 예정”이라고 덧붙였다.
오픈AI가 엄격한 격리 환경에서 내부 평가를 진행했음에도 이 같은 사고가 발생한 만큼 AI의 사이버 안전에 대한 논란이 커질 것으로 보인다.
특히 폐쇄형으로 운영되는 미국의 상용 AI 모델과 견줘 안전 관련 통제 수준이 낮은 것으로 알려진 중국산 개방형 모델의 성능이 크게 향상되면서 이를 악용한 사이버 공격이 더 늘어날 가능성도 제기된다.
실제 허깅페이스는 애초 이번 해킹 공격을 중국 즈푸(智譜·Z.ai)의 개방형 모델 GLM 5.2로 분석하기도 했다. 주요 상용 모델은 내장된 안전장치 때문에 사이버 공격의 로그 분석을 거부한 반면 GLM 5.2는 이를 수행했기 때문이다.
허깅페이스는 “자율적인 AI 기반 공격이 더는 이론상 개념이 아니다”라며 공격뿐 아니라 방어에도 AI를 적극적으로 활용해 속도를 따라잡아야 한다고 강조했다.
윤예림 기자
ⓒ 트윅, 무단 전재 및 재배포 금지
[ 내안의 AI 본성 분석 :
UNMASK ]
"기사를 읽는 동안 깨어난 당신의 숨겨진 페르소나를 AI가 스캔합니다."
기사 읽는 습관에 숨겨진 당신의 MBTI는?
Q.
기사를 끝까지 읽으셨나요? 이제 AI 퀴즈로 기사의 핵심 내용을 점검해보세요.
기사를 다 읽으셨나요? AI 퀴즈로 핵심 점검!
오픈AI 모델들이 해킹 공격을 한 주요 이유는 무엇인가?















































