TL;DR
- Epoch AI의 벤치마킹 허브는 2019년 10월 이후 공개된 약 1,200개 모델 버전의 결과를 80개 이상 벤치마크에서 모아 매일 갱신하는 데이터셋임.
- 각 행은 하나의 모델 버전과 벤치마크, 평가 설정에 해당하며, 점수·평가 주체·출처 링크를 포함함.
- 2026년 10월 1일 기준 약 6,800건의 결과가 수록됐고, 2026년 10월 2일 페이지에는 6,843행으로 표시됨.
- 점수 단위와 평가 설정이 서로 다를 수 있으며, 출처에 따라 표준 오차·결과 날짜·모델 정보가 비어 있을 수 있음.
- 모델 순위 비교, 출시 시점별 점수 추적, 독립 평가와 연구실·논문 결과 비교, 학습 연산량 및 모델 접근 방식과의 관계 분석에 활용 가능함.
데이터셋 개요
- 데이터셋은 Epoch AI의 벤치마킹 허브에 게시된 결과를 모으며, GPQA Diamond와 SWE-bench Verified부터 FrontierMath와 Humanity's Last Exam까지 80개 이상 벤치마크를 포함함.
- 모든 점수는 각자의 단위로 유지되며, 평가 수행 주체와 출처 링크가 함께 제공됨. 모델 순위 산출, 출시별 점수 변화 추적, 연구실·논문 수치와 독립 평가 비교에 활용 가능함.
- 2026년 10월 1일 기준 약 6,800건의 결과가 약 1,200개 모델 버전, 710개 모델에 걸쳐 수록됨. 개발사는 OpenAI, Anthropic, Google DeepMind, Meta, Alibaba 및 약 60개 기타 개발사임.
- 각 행은 하나의 평가 설정에서 한 모델 버전이 한 벤치마크에 기록한 결과 하나임.
포함 범위
- 기간: 2019년 10월 이후 출시된 모델부터 Epoch AI의 최신 갱신 시점까지이며, 대부분은 2025년과 2026년 출시 모델임. 날짜는 UTC 기준 달력 날짜임.
- 행 단위: 공개 결과 하나당 한 행임. 샷 수, 하네스, 추론 노력 또는 출처가 다르면 같은 모델이 한 벤치마크에서 여러 행을 가질 수 있음.
- 갱신 주기: Epoch AI의 다운로드 데이터를 바탕으로 매일 다시 구축됨. Epoch AI는 2026년 9월 29일부터 10월 1일까지 벤치마크 표 36개를 변경함.
- 신규 벤치마크: Epoch AI가 Capabilities Index에 추가한 벤치마크는 전체 표가 빌드에 포함되기 전까지 모델 계열별 최고 점수 하나가 자동으로 나타남.
열 설명
result_id: Epoch AI가 결과에 부여한 기록 식별자. Epoch AI가 식별자를 제공하지 않은 경우 행의 해시값임.benchmark,benchmark_release_date: Epoch AI가 사용하는 벤치마크 이름과 벤치마크 공개 날짜임.model,model_version: 모델 계열과 평가된 정확한 버전이며, 대개 개발사의 API 이름에 Epoch AI의 추론 설정 접미사가 더해짐.organization,country,model_access,model_release_date: 개발사, 개발사 소재 국가, 모델 공개 방식(API 또는 오픈 웨이트), 모델 출시 날짜임.training_compute_flop: 부동소수점 연산 횟수로 나타낸 Epoch AI의 학습 연산량 추정치임.score,score_unit,higher_is_better: 공개된 점수, 점수 단위, 점수가 높을수록 좋은지 여부임. 단위는 비율, 퍼센트, 10점 만점 점수, 엘로(Elo) 평점, 평점, 속도 향상 배수, 브라이어 점수, 지수 점수 또는 미국 달러임.score_fraction: 비율로 점수를 매기는 벤치마크의 0~1 범위 점수임.stderr: 출처에서 보고한 점수 단위의 표준 오차임.result_date: 출처에 날짜가 있을 경우 실행, 채점, 추가 또는 갱신 날짜임.reported_by: 자체 실행 결과의 Epoch AI, 리더보드, 모델 개발사, 논문 또는 보고서, 또는 미기재 중 하나임.source,source_url: 인용된 논문·리더보드·사이트와 링크, 또는 Epoch AI 자체 평가의 평가 로그임.evaluation_setup: 동일 모델의 여러 결과를 구별하는 샷 수, 하네스, 에이전트, 추론 노력 또는 제공업체 정보임.notes,epoch_file: 결과에 관한 Epoch AI의 메모와 다운로드 파일에서 해당 행이 나온 파일임.
누락값과 주의 사항
- 빈 셀은 출처가 해당 값을 공개하지 않았음을 뜻함.
- 숫자 점수나 모델명이 없는 행은 제외됨. 2026년 10월 1일 기준 공개 행 가운데 약 70건이 이에 해당함.
- 오래된 모델의 결과에는 조직, 접근 유형 또는 출시 날짜가 빠진 경우가 많음. 대부분의 결과에는 표준 오차나 결과 날짜가 없음.
- Epoch AI는 연구실 자체 보고 결과를 별도로 표시하지 않음. 따라서 연구실 자체 수치는 학술 논문 결과와 함께
Paper or report및Model developer로 분류됨.
활용 사례
- 벤치마크 하나를 기준으로 모델 순위 산출
- 모델 출시 날짜에 따른 최고 점수 변화 추적
- Epoch AI의 독립 평가와 리더보드·논문·연구실 수치 비교
- 벤치마크 점수와 학습 연산량 및 모델 접근 방식 간 관계 분석
출처와 이용 조건
- 모든 행은 Epoch AI의 벤치마킹 허브에서 가져오며, 다운로드 데이터를 매일 읽어 반영함.
- Epoch AI 자체 평가 결과는 크리에이티브 커먼즈 저작자표시 4.0 라이선스로 공개됨. Epoch AI가 다른 프로젝트에서 취합한 결과에는 해당 프로젝트의 라이선스가 적용되므로 Epoch AI와 각 행에 연결된 출처를 함께 표시해야 함.
- 데이터 테이블 이름은
llm_benchmark_results이며, 페이지에는 22개 열과 2026년 10월 2일 기준 6,843개 공개 행이 표시됨. 상태는 실시간(Live)이며 마지막 게시일과 갱신일은 모두 2026년 10월 2일임. - 다운로드 엔드포인트
/coverage/data/benchmark_data.zip에는 공개 리더보드·논문·보고서에서 Epoch AI가 취합한 ANLI 점수가 포함됨./data/processed_data_for_eci.csv에는 각 Epoch Capabilities Index 벤치마크에서 모델 계열별 최고 점수를 무작위 기준점과 상한 사이로 조정한 값이 포함됨. - 게시자 표시는 Mostly Right, 공개 범위는 Public, 라이선스는 Not stated임. 주제는 LLM 벤치마크, 대형 언어 모델, AI 평가 외 4개 항목임.
- 데이터셋 세부 정보에는 테이블 1개, 약 6,843개 행, 22개 열로 표시됨. 버전은 v1이며, 최근 30일간 조회 294회, 좋아요 0회, 사용 10회로 표시됨.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요