AI Briefing

Photoroom, PRX 모델 데이터 전략 공개

PRX Part 4: Our Data Strategy

·2026.07.07 00:30

Photoroom이 PRX 모델 학습을 위해 사용한 데이터 파이프라인과 캡셔닝 철학을 공개했습니다.

Photoroom의 PRX 모델 성능을 뒷받침하는 데이터 파이프라인의 핵심 전략을 다룹니다.

데이터 수집 및 구성 원칙

  • 다양성 중심의 Pre-training: 초기 단계에서는 미적 완성도보다 시각적 개념과 구성을 배우는 것이 중요하므로, 과도한 필터링을 지양하고 데이터의 커버리지와 다양성을 확보하는 데 집중했습니다.
  • 하이브리드 데이터 소스: 공개 데이터셋과 내부 데이터셋을 혼합하여 사용하며, 기존의 품질 필터링이 완료된 데이터셋을 활용해 효율성을 높였습니다.
  • Long Captioning 전략: 짧은 캡션 대신 이미지의 모든 요소를 상세히 설명하는 **긴 캡션(Long Captions)**을 사용하여 모델이 이미지 내의 노이즈(로고, 텍스트 등)까지도 제어 가능한 속성으로 학습하도록 유도했습니다.

데이터 포맷 및 엔지니어링

  • Mosaic Streaming & MDS: 분산 학습의 유연성과 성능을 위해 Mosaic Data Shards(MDS) 형식을 사용했습니다.
  • Lance 활용: MDS의 경직된 구조를 보완하기 위해, 피처 엔지니어링 및 데이터 큐레이션 단계에서는 컬럼형 데이터 포맷인 Lance를 사용하여 효율적인 데이터 조작을 수행했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.