AI Briefing

Jane Street, flow matching으로 시장 데이터 생성 시 DDPM 불안정성 해결

·2026.10.09 23:56

핵심 내용

Jane Street 인턴 프로젝트가 DDPM의 불안정성을 해결하고 flow matching으로 시장 데이터를 안정적으로 생성함을 입증했다.

1 / 8

자세히 보기

Jane Street가 2026년 여름 인턴십 프로젝트에서 자기회귀 확산 모델을 활용해 시장 데이터 이벤트를 합성하는 연구를 공개했다. 이 연구는 단순한 가격 예측을 넘어 이벤트 타이밍, 가격, 유형(거래 대 BBO 업데이트)을 포함한 전체 주문 장부 스트림을 생성하는 것을 목표로 했다.

모델 아키텍처와 Flow Matching

프로젝트는 Autoregressive Image Generation without Vector Quantization에서 영감을 받은 인코더-디퓨저 아키텍처를 사용했다. 인과적 마스킹이 적용된 Transformer 인코더가 잠재 임베딩을 생성하며, 이는 작은 이벤트 유형 헤드(범주형)와 확산 헤드(가격 및 시간 등 연속 타겟)로 전달된다.

핵심 기술적 발견은 이 맥락에서 DDPM(Denoising Diffusion Probabilistic Models)이 불안정하다는 점이었다. DDPM 궤적이 폭발하여 값의 **88-95%**가 평균에서 8 표준편차 이상 벗어났다. 연구진은 노이즈와 데이터 사이를 선형으로 보간하는 flow matching으로 전환했으며, 이는 더 적은 단계에서도 정확하게 적분 가능한 안정적이고 거의 직선에 가까운 궤적을 생성했다.

이산적 시장 미시구조 처리

시장 데이터는 완전히 연속적이지도, 완전히 이산적이지도 않다는 점이 핵심 과제였다. 주문 도착 시간과 같은 특성에서는 0초나 정수 초에서 점질량(스파이크)이 나타나고, 가격은 호가 중간값 주변에 군집한다. 표준 확산 모델은 이러한 불규칙한 분포를 처리하는 데 어려움을 겪었다.

두 가지 접근 방식이 테스트되었다:

  • 범주형 분할: BBO 변경 사항을 20개 클래스(예: '크기만 변경', '매도 호가 상승')로 나누어 불연속성을 명시적으로 처리했다. 이는 한계 분포를 개선했지만, 광범위한 수동 엔지니어링이 필요했으며 고카디널리티 특성으로 확장하기 어려웠다.
  • 원자 스무딩: 실제 분포의 날카로운 스파이크를 부드럽게 한 후 확률 질량을 재형성하는 절차다. 이 방법은 flow matching과 결합되어 판별기 분류기를 통해 검증된 더 현실적인 샘플을 생성했다.

결과 및 한계

모델은 4년간의 미국 주식 데이터로 평가되었다. 원자 스무딩 기술은 단일 단계 생성의 현실성을 개선했지만, 자기회귀 롤아웃은 시간이 지남에 따라 성능이 저하되어 합성 스프레드가 실제 데이터보다 넓어졌다. 연구는 시장 미시구조에 내재된 연속 값과 이산 행동의 혼합을 포착하기 위해, 시장 데이터를 위한 실행 가능한 생성 모델이 연속 확산과 이산 범주형 모델링 간의 균형을 신중하게 맞춰야 한다고 결론지었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.