Samaya가 금융 정보에 접근하도록 구성한 예측 환경에서 최신 프런티어 AI 모델이 기업 실적을 예측해 애널리스트 컨센서스보다 낮은 오차를 냈다고 밝혔다. 분석 대상은 456개 기업의 실적 발표였으며, 편향을 보정한 더 강한 기준선까지 넘어선 모델은 Claude Fable 5.1, Claude Opus 5.5, GPT-6 Astra였다.

모델은 실적 발표 5거래일 전에 공개된 정보만 이용해 매출, 매출총이익률, 영업이익, 조정 주당순이익(EPS)을 예측했다. Samaya는 자사 예측 환경에서 미래 정보 접근을 차단하고, 실시간 금융 자료와 뉴스 출처를 제공했다. 비교 대상은 애널리스트 추정치의 중앙값인 컨센서스와 기업별 과거 실적 서프라이즈를 반영해 높인 편향 보정 컨센서스다.

Samaya에 따르면 테스트한 7개 모델은 모두 원래 컨센서스보다 나은 결과를 보였고, 가장 최신 모델 3종은 편향 보정 컨센서스도 앞섰다. GPT-6 Astra는 매출 예측 오차, 전체 예측 오차, 적중률에서 가장 높은 성능을 보였으며, 서프라이즈 상관도에서는 Fable 5.1과 Opus 5.5가 앞섰다. 모델 성능은 지표별로 차이가 났고, 매출과 매출총이익률 예측이 영업이익과 조정 EPS보다 컨센서스 대비 나았다.

결과를 해석할 때 볼 조건

실험에는 7개 모델이 참여했다. GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5, GPT-5.6 Sol, Claude Sonnet 5, Gemini 3.8 Flash, Kimi K3다. 기업은 시가총액 50억 달러 초과, 추정치를 제공하는 브로커 8곳 초과 조건으로 골랐으며, 7월 14일 이후 실적을 발표한 456개 기업을 대상으로 했다. 원문은 해당 발표 시점이 모든 모델의 지식 기준일 이후라고 설명한다.

성과는 예측값과 실제값의 차이, 예측한 서프라이즈와 실제 서프라이즈의 상관도, 컨센서스를 기준으로 실적이 상회하거나 하회할 방향을 맞힌 비율로 평가했다. 기업별 과거 실적 변동성으로 오차를 보정했다. 애널리스트가 실적 발표 전에 추정치를 낮추는 경향이 있어 실제 실적이 컨센서스를 웃도는 경우가 잦다는 점을 고려해, 각 기업의 과거 중앙값 서프라이즈를 더한 기준선도 마련했다.

Samaya의 추가 분석에서는 최신 자료 접근이 중요하게 나타났다. 자료 없이 모델 자체 지식만 사용한 경우 성과가 낮았고, 분기 초 자료를 제공하면 성과가 25%포인트 높아졌다. 그러나 실적 발표 5거래일 전까지의 자료를 이용한 설정과는 여전히 12~16%포인트 차이가 있었다. 전문가 지침을 추가하면 모델이 조사에 쓰는 시간과 문맥이 약 1.6~2.7배 늘고 예측 오차가 감소했다고 Samaya는 보고했다.

컨센서스를 가린 실험에서는 성능이 낮은 모델이 컨센서스에 크게 의존했지만, 모델 성능이 높아질수록 그 차이가 줄었다. GPT-6 Astra는 컨센서스에 접근할 수 있을 때와 없을 때 거의 같은 성능을 냈다. Samaya는 모델이 공개 정보에서 컨센서스를 재구성했을 가능성을 제시했다.

이 결과는 Samaya가 만든 정보 접근 환경과 해당 기업·분기·지표를 대상으로 한 연구 결과다. Samaya는 실적 예측 에이전트의 알파 버전을 제품에서 사용자와 고객에게 제공하고 있으며, 내부 자료에 맞춘 분석도 고객과 협력해 개발 중이라고 밝혔다. 예측 과정이 실제로 주요 요인을 안정적으로 찾아내는지 등은 추가 연구 과제로 남겼다.

원문 자료