TL;DR

  • FinTrace는 금융 LLM 에이전트가 기준 시점 이후의 정보를 참조하지 않도록 통제하고, 모든 주장을 공시 근거까지 추적할 수 있게 하는 연구 도구임.
  • 기준선 실험은 공시 시점 기준 사실 1억 2,500만 건과 200개 과제로 진행됐으며, 게이트 적용 에이전트의 T1·T2 정확도는 각각 92%·93.3%임.
  • 시간 게이트가 없는 실시간 데이터 에이전트는 답을 알 수 없는 과제 17개 중 14개(82%)에서 실제 미래 값을 답했으며, 이는 성능 향상이 아니라 미래 정보 누출임.
  • 두 차례의 전체 기준선 실행에 든 LLM 비용은 합계 약 ¥4.4(약 $0.6)임.
  • FinTrace는 활발히 개발 중인 연구 소프트웨어이며 투자 조언이 아님.

FinTrace · PITfall

  • FinTrace는 감사 가능한 시점 기준 금융 조사 에이전트와 누출 통제 벤치마크인 PITfall을 제공하며, 모든 주장을 실제 제출된 공시 근거까지 추적하고 미래 정보 참조를 차단함.
  • 가입이나 API 키가 필요 없는 실시간 데모는 fintrace-demo.streamlit.app에서 이용 가능하며, 회사·지표·지식 기준 시점을 선택해 시점 기준 답변과 단순 실시간 데이터 API의 답변을 비교할 수 있음.
  • 현재 기준선 실험이 완료된 상태이며, 공시 시점 기준 사실 1억 2,500만 건을 보유함.
  • 핵심 200개 벤치마크 결과는 T1 92%, T2 93.3%, T3 50%이며, 부트스트랩 95% 신뢰구간은 기술 보고서에 수록됨.
  • 누출 감사에서 단순 실시간 데이터 에이전트는 답을 알 수 없는 질문의 82%에 실제 미래 값을 답함.
  • 두 차례 전체 기준선 실행의 LLM 비용은 합계 약 ¥4.4(약 $0.6)임.
  • 자세한 상태는 docs/00-STATE.md에서 확인 가능함.
  • 이 소프트웨어는 활발히 개발 중인 연구용이며 투자 조언이 아님.

구성 요소

  • fintrace-data: 제출 시각으로 필터링하는 시점 기준 EDGAR 수집 및 실제 제출된 XBRL 사실 데이터임.
  • as_of(T): 런타임과 벤치마크가 공유하는 시점 기준 질의 기본 요소이며, 기본값이 없고 미래 정보 참조를 허용하지 않음.
  • pitfall-bench: 시간 제한 질의응답, 주장 검증, 미래 추정으로 구성된 누출 통제 벤치마크임.
  • auditpack: 주장, 근거 연결, 실행 로그, 승인 서명을 담는 개방형 감사 추적 스키마임.
  • 기술 보고서 초안은 reports/technical-report.md에 있음.

결과 — 동일 벤치마크의 세 가지 설정

  • 고정된 core-200 벤치마크는 T1 100개(기준일에 답이 공개되지 않은 불가능 과제 17개 포함), T2 60개, T3 40개로 구성됨.
  • 기준선의 백본 모델은 deepseek-chat이며, 부트스트랩 95% 신뢰구간은 기술 보고서에 제시됨.
  • 설정별 결과는 다음과 같음.
  • 베어 모델(GLM-4.7, 도구 없음): 불가능 과제의 실제 미래 값 답변 2/17(11.8%), T1 2%, T2 55.0%, T3 12.5%임.
  • 베어 모델(deepseek-chat, 도구 없음): 불가능 과제의 실제 미래 값 답변 2/17(11.8%), T1 5%, T2 53.3%, T3 25.0%임.
  • 단순 에이전트(시간 게이트 없는 실시간 데이터 도구): 불가능 과제의 실제 미래 값 답변 14/17(82%), T1 77%, T2 86.7%, T3 80%임.
  • 게이트 적용 FinTrace 에이전트: 불가능 과제의 실제 미래 값 답변 0/17이며, 16/17을 올바르게 ‘알 수 없음’으로 답함. T1은 92%, T2는 93.3%, T3는 50%임.
  • T3 통과 기준은 평균 절대 백분율 오차(APE) 20% 이하임.
  • 단순 에이전트의 T3 ‘예측’ 성능이 50%에서 80%로 높아진 현상과 불가능 질문 누출 82%는 지능 향상이 아니라 미래 정보 접근에 따른 결과임.
  • T1에서 긍정 과제만 비교하면 단순 에이전트는 게이트 적용 에이전트와 사실상 차이가 없으며, 정확도는 각각 93%와 92%임.
  • 이러한 양상은 두 모델 계열 모두에서 재현됨.
  • 재현 절차는 fintrace pitfall-generate → pitfall-run → pitfall-leak 순서임.

빠른 시작

  • 사람 개발자를 위한 온보딩 순서는 make onboard로 환경을 확인하고 온보딩 자료를 읽은 다음, make setup으로 도구 체인을 설치하고 make check로 ruff·mypy·pytest를 실행하는 방식임.
  • AAPL의 Revenues 태그와 2022-09-24 기간 종료 값을 2023-01-01 기준으로 질의하는 예시는 uv run fintrace query-fact --ticker AAPL --tag Revenues --period-end 2022-09-24 --as-of 2023-01-01임.
  • 모든 질의에는 설계상 필수인 as_of 날짜가 필요하며, 시점 T에 무엇을 알 수 있었는지가 라이브러리의 핵심 계약임.

라이선스

  • Apache-2.0 라이선스임.