!원문 캡처 · blog.janestreet.com

Jane Street의 2026년 여름 연구 인턴 Kavish는 주문·취소·체결 같은 시장 이벤트를 생성하는 자기회귀 확산 모델을 만들었다. 실험 결과, 흐름 매칭과 ‘원자 평활화’를 적용하면 일부 분포와 샘플의 현실성이 나아졌지만, 모델은 아직 현실적인 시장 데이터 생성에 충분히 정확하지 않았다.

주식 시장 데이터에는 연속적인 값과 이산적인 행동이 함께 있다. 가격이나 주문 도착 시간은 연속적으로 보이지만, 주문은 매수·매도 호가를 한 틱 올리거나 취소하는 식의 이산적인 행동으로 발생한다. 도착 시간과 가격도 특정 값 주변에 몰리는 급격한 분포를 보인다. 이런 특성 때문에 연속 데이터를 다루는 확산 모델을 그대로 적용하기 어렵다.

Kavish는 미국 주식의 4년치 데이터를 사용했다. 각 행에는 시각, 가격, 이벤트 종류(체결·주문·취소 등)와 기타 정보가 담겼다. 모델은 다음 이벤트를 예측하고, 이를 기존 이벤트 흐름에 차례로 추가하도록 구성했다. 구조는 인과 마스킹 트랜스포머 인코더와 확산 디코더를 결합했다. 인코더는 이벤트별 잠재 표현을 만들고, 분류 헤드는 다음 이벤트가 체결인지 최우선 매수·매도 호가(BBO) 업데이트인지 예측한다. 가격과 경과 시간 같은 연속 값은 이벤트 종류를 조건으로 생성한다.

DDPM보다 안정적이었던 흐름 매칭

초기에는 1,000단계 코사인 스케줄을 쓰는 DDPM(잡음 제거 확산 확률 모델)과 DDIM 샘플링을 적용했다. 하지만 연속 목표 7개 모두에서 생성 값의 88~95%가 분포 평균으로부터 표준편차 8배 이상 벗어나는 불안정성이 나타났다. 샘플링 단계를 늘리거나 무작위성을 더해 완화할 수 있었지만, Kavish는 별도 조정 없이 더 잘 작동한 직선화 흐름(rectified flow) 방식의 흐름 매칭으로 전환했다.

확산 모델은 이미지 생성 등에서 쓰이며, DDPM은 추가된 잡음을 예측해 원래 값을 복원한다. 반면 흐름 매칭은 잡음과 데이터 사이를 직선으로 보간하고 그 경로의 속도를 학습한다. Kavish의 실험에서는 두 방식의 차이가 시장 데이터 생성의 안정성에 중요하게 작용했다.

이산적인 급격한 분포 다루기

주문 도착 시간은 정규분포처럼 퍼지지 않았다. 같은 시각에 도착하는 이벤트, 가능한 가장 빠른 반응 시간, 정수 초 주변에 값이 몰렸다. 가격도 매수·매도 호가의 중간값이나 현재 매수·매도 호가 주변에 집중됐다.

Kavish는 먼저 이벤트 종류를 더 세분화하는 방법을 시험했다. 전체 이벤트 중 체결은 8%뿐이라 분류 헤드가 체결을 과도하게 예측하는 문제가 있었고, BBO 업데이트를 ‘크기만 변경’, ‘매도 호가 상승’, ‘매수 호가 하락’ 등으로 나눴다. 0초의 경과 시간이나 가격 변화 방향처럼 급격한 불연속이 있는 값도 별도 범주로 처리했다. 이 방식은 이벤트 종류와 연속 목표의 주변 분포를 개선했지만, 변수와 범주가 많은 데이터에 적용하기에는 수작업이 많이 들고 범주 수가 지나치게 커질 수 있다.

대안으로 ‘원자 평활화(atom smoothing)’를 사용했다. 뾰족한 분포를 먼저 부드럽게 만든 뒤, 그 지점의 확률 질량을 다시 반영해 불연속 없이 급격한 집중을 표현하는 방법이다. 효과를 얻으려면 변수 표현을 적절히 골라 뾰족한 분포가 드러나도록 해야 한다.

평가와 한계

모델의 주변 분포는 실제 데이터의 다음 이벤트와 비교했다. 실제 이벤트 10,240개를 문맥으로 제공하고, 다음 이벤트 하나를 생성해 실제로 이어진 이벤트와 대조하는 방식이다. 두 분포의 차이는 총변동(TV) 발산으로 측정했다. 주변 분포 비교만으로는 변수 간 관계나 시간에 따른 일관성을 평가하기 어려워, 실제 문맥 뒤에 생성 이벤트 또는 실제 이벤트를 붙여 둘을 구분하는 분류기도 학습했다. 원문은 원자 평활화에 맞춘 변수 표현을 쓴 생성기의 샘플이 더 현실적으로 보였다고 설명한다.

자기회귀 방식으로 여러 이벤트를 연이어 생성하면 예측은 먼 미래로 갈수록 저하됐다. 원문은 추가 연구 과제로 성능 저하의 정도를 제시하며, 예시 그래프에서 CME US의 스프레드가 합성 데이터에서 넓어지는 모습을 언급한다. Kavish의 모델은 아직 현실적인 생성기로 쓸 만큼 정확하지 않다. 이번 연구가 드러낸 핵심 과제는 어떤 값을 범주형으로 예측하고 어떤 값을 확산으로 생성할지, 그리고 급격한 분포를 어떻게 표현하고 평활화할지다.

참고 자료