멀티모달 주입데이터
Update: 500K+ multimodal prompt injection samples - v5 adds reasoning DoS, video jailbreaking, LoRA supply chain, and 8 more attack categories from 40+ papers
503,358개 멀티모달 prompt injection 데이터셋 v5가 공개됐다.
Bordair Multimodal Prompt Injection Dataset가 503,358개 라벨 샘플을 공개했다.
공격 251,782개와 정상 251,576개를 거의 1:1로 맞췄고, 범위는 runtime injection만 포함한다. training-time poisoning, pure jailbreak, 일반 소셜 엔지니어링은 제외했다.
v1~v5와 외부 데이터 ingestion을 통해 범위를 넓혔고, 출처는 40+ papers와 문서화된 산업 연구를 따른다.
- cross-modal, multi-turn, adversarial suffix, jailbreak template
- indirect injection, tool manipulation, agentic, evasion, reasoning DoS
- video generation jailbreaking, VLA robotic, LoRA supply chain
- audio-native LLM, RAG optimisation, MCP cross-server, coding agent
- serialization boundary, agent skill supply chain
구성은 수작업 seed, PyRIT 템플릿/인코딩 확장, cross-modal 전달, benign 샘플 혼합으로 이뤄졌고, 모든 샘플에 expected_detection 라벨과 공격 출처가 붙는다.
감사 과정에서는 benign에서 주입 패턴이 섞인 221개를 제거하고, 실제 OpenAI API key가 포함된 2개 공격 샘플도 삭제했다. 빈 text 필드나 애매한 video safety prompt는 cross-modal threat model상 의도된 플래그다.
CLI는 OpenAI-compatible endpoint에 붙여 카테고리별 Attack Success Rate를 바로 측정할 수 있고, OpenAI·Anthropic·Groq·Together·Fireworks·Ollama·LM Studio·vLLM을 지원한다.
한계도 분명하다. multimodal 필드는 실제 바이너리가 아니라 extractor가 읽는 텍스트 표현이고, benign 풀은 영어·짧은 프롬프트에 치우치며, 라벨은 개별 검수보다 category-level 생성 규칙에 의존한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.