AI Briefing

Hugging Face 학습 데이터 7.6페타바이트에서 비밀정보 스캔

·2026.06.01 09:00

Hugging Face 공개 학습 데이터에서 유효한 자격증명 22만 개가 발견됐다.

Truffle Security가 Hugging Face의 모든 공개 데이터셋을 대상으로 7.6PB, 1억8,700만 개 파일을 스캔한 결과, 6,003개 데이터셋에서 유효하고 중복되지 않은 자격증명 221,303개를 발견했다고 밝혔다.

가장 큰 영향을 줄 수 있는 자격증명 중 하나는 약 **393GB의 개인정보(PII)**에 접근할 수 있었으며, 이는 전 세계 인구의 약 **3.7%**에 해당하는 규모로 추정됐다. 구체적인 내용은 후속 보고서에서 공개할 예정이다.

공급망 공격으로 이어질 수 있는 쓰기 권한 토큰도 확인됐다.

  • GitHub Personal Access Token 349개: repo 전체 쓰기 권한 223개, CI workflow 수정 권한 130개, admin:org 권한 112개, 패키지 게시 권한 110개
  • Docker Hub push 토큰 318개
  • Hugging Face 쓰기 토큰 237개 및 조직 관리자 토큰 70개

일부 토큰은 널리 사용되는 MCP 레지스트리 창립자의 계정과 연결돼 있었고, 해당 조직의 저장소들은 주요 AI 코딩 도구가 사용하는 서버와 SDK를 포함하며 총 17만8,000개 이상의 GitHub stars를 보유한 것으로 확인됐다. 연구진은 관련 개인과 조직의 이름을 공개하지 않고 책임 있게 통보했다고 설명했다.

인프라 접근 권한도 광범위했다.

  • GCP 서비스 계정 키 8,557개: 3,811개 프로젝트와 연결
  • 비공개 S3 버킷 51.7TB 접근 권한
  • 작동하는 데이터베이스 로그인 8,594개, 메타데이터 기준 3.5TB 규모
  • Slack 및 Mailgun 키 5,885개

연구진은 검증과 영향 범위 확인을 위해 데이터베이스 크기, Redis 메모리 사용량, S3 버킷 용량 같은 메타데이터만 확인했으며, 데이터베이스 행이나 객체 목록을 읽거나 파일을 다운로드하고 시스템을 변경하지는 않았다고 밝혔다. Hugging Face는 조사에 협력했으며, CTO Julien Chaumond는 TruffleHog에 스토리지 버킷 스캔 기능을 추가했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.