허깅 페이스는 통치 실패였다​​ 

AI 환경을 재편하고 있지만, 최근 보안 사건에 대한 과장된 주장으로 인해 그 방식이 가려질 수 있습니다. 이 글은 Insikt Group의 진행 중인 "AI 과대광고 vs. 현실" 시리즈의 일부로, AI 개발을 둘러싼 소음을 걸러내고 실제 증거가 무엇을 보여주는지, 그리고 그 결과 AI 옹호자들이 무엇을 옹호해야 하는지를 살펴봅니다.​​ 

에이전트 방어는 에이전트 공격에 대응하는 데 필수적입니다. 하지만 방어자들은 자율 시스템이 예상 범위를 벗어나 작동할 위험을 적극적으로 완화해야 합니다.​​ 
2026년 7월, OpenAI는 내부 사이버 보안 평가를 받고 있던 모델이 테스트 환경을 벗어나 Hugging Face의 프로덕션 인프라의 일부로 유출되었다고 밝혔
. OpenAI는 이 사건

전례 없는 사이버 인시던트"라고 규정했습니다.인시던트는 보안 책임자들을 경보 시스템에 포함시켜야 하지만, 오픈AI가 제시하는 이유 때문은 아닙니다.​​ 

한 가지 우려 사항은 OpenAI의 에이전트가 엔드투엔드 사이버 공격을 자율적으로 수행할 수 있는 능력을 입증하여 Recorded Future의 AIM3 프레임워크 내에서 최고 수준의 자율성을 확보했다는 점입니다. 하지만 더 큰 문제는 모델 운영자들이 무단 에이전트 활동을 충분히 감시하거나 완화할 준비를 하지 않았다는 점입니다. 보안 및 기타 목적으로 에이전트를 사용하는 기업은 '허깅 페이스 인시던트' 사건을 에이전트를 안전장치 없이 풀어놓았을 때 발생하는 부작용에 대한 경고로 받아들여야 합니다.​​ 

무슨 일이에요​​ 

인시던트는 고급 사이버 역량을 측정하기 위해 설계된 OpenAI 평가 중에 시작되었습니다. 이번 평가에는 GPT-5.6 Sol과 OpenAI가 공개용으로 개발하지 않았다고 밝힌 더욱 강력한 내부 조사 프로토타입이 사용되었습니다. 목표가 최대 공격력을 시험하는 것이었기 때문에, 해당 모델들은 (일반적으로 고위험 활동을 방지하기 위해 사용되는) 안전장치를 완화한 상태로 운용되었습니다.​​ 

OpenAI 에 따르면, 해당 모델들은 인터넷 연결 경로를 찾는 데 상당한 컴퓨팅 자원을 소모했습니다. 그들은 평가 환경에서 사용 가능한 패키지 레지스트리 캐시 프록시인 Artifactory의 제로데이 취약점을 악용하여 OpenAI 연구 환경 내에서 권한 상승 및 측면 이동을 수행한 후 인터넷에 접속할 수 있는 노드에 도달했습니다.​​ 

온라인 상태가 되자, 모델들은 Hugging Face에 자신들이 해결하도록 지시받았던 벤치마크인 ExploitGym과 관련된 모델, 데이터 세트 또는 솔루션이 포함되어 있을 수 있다고 추론했습니다 . OpenAI는 에이전트가 탈취한 자격 증명, 제로데이 취약점, 원격 코드 실행 경로를 연결하여 Hugging Face 운영 데이터베이스에서 테스트 솔루션을 얻었다고 밝혔습니다.​​ 

허깅 페이스의 기술적 재구성은 2026년 7월 9일부터 7월 13일 사이에 발생한 약 17,600건의 복구된 에이전트 활동을 약 6,280개의 클러스터로 분류한 결과를 포함합니다. 대부분의 시도는 실패했지만, 해당 요원은 내부 및 운영 시스템에 대한 관리자 권한을 획득하고, 일부 소스 코드 저장소에 접근했으며, 탈취한 자격 증명을 사용하여 외부 시스템을 회사 네트워크에 연결했습니다. Hugging Face는 자사의 공개 모델, 데이터 세트, 서비스, 패키지 또는 공개된 소프트웨어 공급망이 변경되었다는 증거를 찾지 못했습니다. 접근한 고객 콘텐츠는 ExploitGym 또는 CyberGym과 관련된 것으로 보이는 5개의 데이터 세트뿐이라고 합니다.​​ 

역량 혁신과 통제 실패​​ 

이번 인시던트에 대한 대부분의 보도는 이를 모델 역량의 획기적인 발전으로 규정했는데, 이는 모델이 독립적으로 엔드투엔드 사이버 공격을 수행한 최초의 사례로 알려져 있기 때문입니다. 기본 TTPs 사람이 주도하는 사이버 공격에서 사용되는 것과 대체로 유사했습니다. 즉, 취약점 악용, 취약점 증명 절도, 스테이징, 원격 코드 실행, 측면 이동, 특권 또는 신뢰 액세스 남용 등이었습니다. 주목할 만한 점은 에이전트들이 장기간에 걸친 작업 과정에서 이러한 단계들을 자율적으로 선택하고 연결할 수 있는 능력을 갖추고 있었다는 것입니다. 이는 미래 인시던트의 속도와 규모 에 있어 상당한 변화를 의미합니다.​​ 

자율 에이전트는 수천 가지의 작업을 실행하고, 여러 경로를 테스트하며, 인간 운영자를 제한하는 피로, 조정 비용 또는 시간 제약 없이 계속 작업할 수 있습니다. 이 경우, 복구된 약 17,600건의 작업 대부분은 실패한 경로와 관련이 있었습니다. 그 운영 방식은 시끄럽고 실패할 가능성이 높았지만, 상당한 영향을 미치기 위해서는 소수의 성공적인 체인만으로도 충분했습니다.​​ 

이것은 시간을 모든 것에 압축시키는 효과를 냅니다.​​ 

이는 방어자에게 있어 에이전트 기반 공격 시대에는 노출된 모든 결함이 치명적인 결과를 초래할 수 있음을 의미합니다. 공격 에이전트는 Hugging Face 환경 전반에 걸쳐 여러 오류를 악용하여 공격을 실행했으며, 이러한 취약점을 찾아내고 인간 운영자보다 훨씬 빠르게 악용했습니다. 빠르게 변화하는 운영 환경에서는 에이전트 공격의 영향을 최소화하기 위해 지속적인 취약점 관리, 위협 가시성 확보 및 위험 완화가 필수적입니다.​​ 

더 큰 위험은 당신의 에이전트에게서 비롯될 수 있습니다.​​ 

기능적인 측면에서 획기적인 발전은 주목할 만하지만, AI 지능은 안전성 측면에서 실패작이기도 하다. 행동적 안전장치를 제거하는 것은 모델의 최대 기능을 측정하는 데 필요했을 수 있지만, 그렇게 함으로써 엄격한 네트워크 격리, 자격 증명 분리, 리소스 제한, 실시간 원격 측정, 사전 정의된 경계를 넘었을 때의 자동 종료와 같은 보완 제어에 대한 의존도를 높여야 했습니다.​​ 

하지만, 고도화된 사이버 활동을 시뮬레이션하기 위해 고안된 평가가 오히려 외부 조직에 영향을 미치는 실제 보안 위협으로 변질되었습니다. 이는 AI 에이전트를 배포하는 모든 조직에 경고가 되어야 합니다. 엄격한 AI 관리 체계가 없다면, 에이전트는 부여된 목표를 추구하면서도 승인된 범위를 벗어난 행동을 할 수 있습니다.​​ 

기업 에이전트는 악의적인 의도가 없더라도 피해를 입힐 수 있습니다. 목표 설정이 부실하고, 권한이 과도하며, 운영 범위가 불충분하면 문제가 발생하기에 충분할 수 있습니다.​​ 

"고객 문제 해결", "조사 완료", 또는 "취약점 수정" 등의 지시를 받은 상담원은 가장 효율적인 방법이 제한된 정보에 접근하거나, 외부 시스템과 상호 작용하거나, 계약 조건을 수락하거나, 운영 코드를 수정하거나, 운영자가 전혀 예상하지 못한 방식으로 자격 증명을 사용하는 것이라고 판단할 수 있습니다. 이러한 것들 중 어느 하나라도 심각한 보안 위협으로 이어질 가능성이 있습니다.​​ 

요원이 특정 행동을 선택했다는 사실이 그 행동을 지시한 조직의 책임을 면제해 주는 것은 아닙니다. 사실관계 및 적용 가능한 법률에 따라 조직은 정보 사용 방식뿐만 아니라 정보 획득 방식에 따라서도 법적, 계약적 또는 규제적 문제에 직면할 수 있습니다.​​ 

경영진 의제​​ 

《허깅 페이스》는 에이전트 공격에 대응하기 위해서는 방어 수단으로 에이전트를 사용하는 것이 필수적이지만, 그에 따른 위험성을 철저히 이해한 상태에서 접근해야 함을 보여준다.​​ 

권한을 관리하고 상위 권한에 대한 견제 장치를 마련하십시오. 모든 에이전트는 명확하게 정의된 신원, 제한된 권한 범위, 그리고 활동에 대한 명확한 제한을 가져야 합니다. 에이전트에게 더 높은 수준의 권한이 필요한 경우, 승인 게이트 또는 추가 모니터링(아래에 자세히 설명)과 같은 완화 제어 조치를 적용해야 합니다.​​ 

행동적 안전장치가 실패하거나 약화될 수 있다는 가정하에 격리 설계를 하십시오. 요청, 거부 및 정책 통제는 보안 경계가 아니라 보호 장치 중 하나로 간주해야 합니다. 네트워크 분할, 송신 제어, 자격 증명 격리 및 실행 제한은 모델이 예상치 못한 방식으로 동작하더라도 계속해서 효과적으로 작동해야 합니다.​​ 

중요한 작업에 대한 승인 단계를 만드세요. 거래, 생산 변경, 외부 커뮤니케이션, 자격 증명 사용 및 중요 시스템 접근에는 확정적인 정책 확인 또는 사람의 승인이 필요해야 합니다.​​ 

출력뿐만 아니라 동작도 모니터링하세요. 조직은 에이전트가 사용하는 도구, 접촉하는 시스템, 사용하는 자격 증명, 소비하는 리소스, 그리고 행동으로 이어지는 일련의 의사 결정 과정을 가시화해야 합니다. 비정상적인 컴퓨팅 자원 사용량이나 경계를 우회하려는 반복적인 시도가 감지되면 조치를 취해야 합니다.​​ 

기계 속도에 필적하는 방어 체계를 준비하십시오. 보안 프로그램은 급속히 증가하는 취약점 및 공격 신호 중에서 어떤 것이 실제 노출로 이어지는지 판단하기 위해 자동화된 정보 보강 및 우선순위 지정 기능을 필요로 할 것입니다. 또한 자동화된 공격자에 대한 효과적인 방어를 위해서는 자동화된 대응 및 완화 시스템이 필수적입니다.​​ 

두 가지 가능한 미래​​ 

에이전트형 AI의 장기적인 영향은 크게 두 가지 변수에 달려 있습니다. 바로 시스템의 역량이 얼마나 향상되는지, 그리고 그러한 역량에 대한 접근성이 얼마나 널리 보급되는지입니다.​​ 

시나리오 1: 역량 확산​​ 

이러한 미래에는 고성능 에이전트가 상업 서비스, 공개 배포판, 그리고 불법적으로 개조된 모델들을 통해 널리 이용 가능할 것입니다.​​ 

공격자는 이러한 에이전트를 사용하여 정찰, 취약점 발견, 사회 공학 및 측면 이동을 자동화합니다. 방어자들은 이러한 기능을 자동화된 대응 및 완화에 적용해야 할 것이며, 이는 기계 속도의 공격과 기계 속도의 방어 간의 경쟁을 가속화할 것입니다.​​ 

이점은 공평하게 분배되지 않을 가능성이 높습니다. 대형 기술 및 보안 기업은 정교한 방어 에이전트를 배포하고, 광범위한 원격 측정 네트워크를 운영하며, 침입 시스템을 신속하게 격리하는 데 더 유리한 위치에 있게 될 것입니다.​​ 

규모가 작은 조직일수록 관리형 플랫폼과 엄격하게 통제된 기술 생태계에 대한 의존도가 높아질 수 있습니다. 그 결과, 조직들이 기계 속도로 보안을 운영할 수 있는 공급업체로 몰리면서 인터넷은 더욱 폐쇄적인 생태계로 구성될 수 있습니다.​​ 

시나리오 2: 국경 접근성 협소화​​ 

두 번째 미래에는 정부와 모델 제공업체가 신뢰 파트너 프로그램, 신원 확인 요건, 지리적 제한 또는 수출 통제를 통해 가장 우수한 시스템에 대한 접근을 제한할 것입니다.​​ 

2026년 6월, 백악관은 연방 기관들에게 "대상 프론티어 모델"을 평가하기 위한 자발적 프레임워크를 설계하도록 지시하는 명령 을 내렸습니다. 같은 달, 상무부는 앤트로픽의 미소스(Mythos) 및 페이블(Fable) 모델에 대해 일시적으로 수출 통제를 적용하여 외국인의 접근을 제한했습니다. 이는 첨단 칩이나 모델 가중치뿐만 아니라 AI 모델 자체에 대한 접근을 규제하는 전례 없는 조치였습니다.​​ 

보도에 따르면 중국 당국은 자국의 최첨단 모델에 대한 외국 접근을 제한하는 유사한 방안을 검토했지만, 리포팅 당시에는 최종 정책이 발표되지 않았다.​​ 

이러한 미래는 첨단 역량을 정부, 핵심 기반 시설 운영자 및 대규모 승인 기관에 집중시킬 것입니다. 다른 기업들은 기존의 상업 모델, 개방형 무게 대안 또는 안전장치를 우회하도록 수정할 수 있는 시스템에 의존할 것입니다.​​ 

제한 조치는 가장 위험한 기능에 대한 광범위한 접근을 줄일 수 있지만, AI 의 악의적인 사용을 완전히 없애지는 못할 것입니다. 범죄 조직들은 계속해서 기존 시스템을 해킹하고, 모델 접근 권한을 훔치고, 개방형 시스템을 이용할 것입니다. 기업은 규제 변경, 공급업체 정책 또는 지정학적 긴장으로 인해 핵심 워크플로에 포함된 모델을 사용할 수 없게 될 경우 갑작스러운 운영 중단에 직면할 수도 있습니다.​​ 

가장 가능성이 높은 미래는 이 둘의 혼합이다.​​ 

이러한 시나리오들은 서로 배타적이지 않습니다.​​ 

더욱 가능성이 높은 미래는 가장 발전된 모델들이 점점 더 접근 제한적인 반면, 기능은 다소 떨어지는 개방형 시스템은 널리 보급된 채로 남아 있는 파편화된 생태계입니다. 범죄자, 국가, 주요 기술 기업, 그리고 일반 기업들은 각기 다른 수준의 역량과 제약 조건 하에서 운영될 것입니다.​​ 

이는 조직이 정부가 위험한 모델을 성공적으로 통제할 것이라는 가정이나 무제한 접근이 무기한으로 지속될 것이라는 가정에 기반하여 보안 전략을 세울 수 없다는 것을 의미합니다.​​ 

그들은 역량 확산과 접근 차단 모두에 대비해야 합니다.​​ 

《허깅 페이스》는 AI 시스템이 인간과 유사한 의도나 독립적인 악의적 목적을 개발했다는 것을 보여주지 않습니다. 그것은 단순한 실험실 사고가 아니었다.​​ 

이는 자율 시스템이 기존 제어 시스템이 감당할 수 없는 속도와 규모로 익숙한 약점을 이용하여, 운영자가 의도한 범위를 벗어난 중대한 외부 행동으로 구체적인 지시를 바꿀 수 있다는 증거입니다.​​ 

현재 경영진에게 가장 중요한 질문은 해당 요원들에게 부여해야 할 권한을 어떻게 관리하고, 승인된 범위를 벗어난 목표를 추구할 가능성과 그로 인한 결과를 어떻게 완화할 것인가 하는 점입니다.​​ 

다음 인시던트에 대비하지 못한 채 당하지 않도록 하세요.​​ 

OpenAI/Hugging Face 인시던트는 에이전트의 자율성, 조직의 책임, 그리고 환경이 얼마나 빠르게 변화하는지에 대해 쉽게 답할 수 없는 질문들을 제기합니다. 패널들이 실제로 무슨 일이 일어났는지, 이것이 에이전트형 AI 위험에 대해 무엇을 시사하는지, 그리고 보안 및 거버넌스 팀이 지금 알아야 하고 해야 할 일은 무엇인지에 대해 심층적으로 분석하는 내용을 들어보세요.​​ 

웨비나를 시청하세요​​ 

"AI 과대광고 vs. 현실" 시리즈에서 더 자세한 내용을 읽어보세요.​​ 

Insikt Group소개®​​ 

Recorded Future의 위협 연구 부서인 Insikt Group은 정부, 법 집행 기관, 군대 등에서 풍부한 경험을 가진 분석가와 보안 연구원으로 구성되어 있습니다.​​  정보기관 경력. 이 회사의 임무는 고객의 위험을 줄이고, 실질적인 결과를 도출하며, 사업 중단을 방지하는 정보를 생산하는 것입니다.​​