TL;DR
- Science Slop Index는 문장별 AI 탐지 대신 논문 전체의 과학적 추론 연결성을 평가하며, 6개 지표와 3개 평면을 종합해 점수를 산출함.
- 논문의 섹션 간 연결, 주장과 인용의 논증, 방법과 증거의 검토 가능성을 분석함.
- SciSlopBench는 같은 문제를 다룬 AI 생성 논문 390편과 인간 작성 논문을 짝지어 비교함.
- 사용자는 링크를 붙여넣거나 PDF·LaTeX ZIP을 업로드할 수 있으며, 분석 보고서는 키로 다시 열고 공개 여부를 직접 선택함.
- SciSlop v2는 커뮤니티 기여를 바탕으로 개발 중이며, 상당한 기여자는 공동 저자로 참여할 수 있음.
Science Slop Index
- 논문은 문장 하나하나가 자연스럽게 읽히더라도 과학적 논리가 서로 연결되지 않을 수 있음.
- 토큰 단위 AI 탐지기와 달리 Science Slop Index는 섹션 간 연결, 주장과 인용의 논증 여부, 방법과 증거의 검토 가능성 등 과학적 추론을 살핌.
- 논문 링크를 입력하거나 PDF 또는 LaTeX ZIP 파일을 업로드해 분석할 수 있음. 보고서는 비공개로 제공되며, 다시 열 수 있는 키가 발급되고 공개 목록에 올릴지는 사용자가 결정함.
- SciSlop v2는 커뮤니티와 함께 작성 중임. 지수가 놓친 문제를 표시하거나 잘못된 판정을 반박하고, 새로운 패턴을 제안할 수 있음.
SciSlop v2 공개 모집
- SciSlop v2의 다음 버전은 커뮤니티가 발견하는 내용을 바탕으로 구축됨.
- 기여 내용은 모두 기록되며, 상당한 기여자는 v2 논문의 공동 저자로 참여할 수 있음.
- 기여 방식은 AI 작성 논문에서 지수가 놓친 점 표시, 자신의 초안 점수 확인 및 오판 수정, 논문 없이 새로운 패턴 제안임.
기여자
- 과학적 허술함을 표시하거나 패턴을 제안한 모든 기여자를 소개함.
- 상당한 기여자는 SciSlop v2의 공동 저자로 초대됨.
팀
- Science or Slop?과 이 사이트를 만든 팀을 소개함.
인용
- Science Slop Index, SciSlopBench 또는 코드를 이용할 경우 다음 논문을 인용하도록 안내함.
- 인용 정보: Oh, Yerim·Lee, Young-Jun·Ahn, Jaewoo·Kim, Gunhee·Kang, Dongyeop, 「Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers」, arXiv 프리프린트, 2026년, arXiv:2610.00531.
- 논문 링크: https://arxiv.org/abs/2610.00531
작동 방식
- 6개 지표와 3개 평면을 사용해 하나의 점수를 산출함.
- 각 지표는 논문 단위 중 특정 패턴을 보이는 단위의 비율을 계산함. 각 평면 안에서 지표 점수를 평균한 뒤, 세 평면의 평균을 내고 100점 만점으로 보고함.
- 점수가 높을수록 짝지은 인간 작성 논문과 비교해 AI 생성 논문을 구별하는 패턴이 더 많이 나타남.
문장이 아니라 논문을 읽음
- AI 텍스트 탐지기는 각 문장의 토큰이 얼마나 예측 가능한지, 모델이 어떻게 표현했을지를 점수화함. 언어 모델이 작성하거나 수정한 논문은 이런 검사를 통과하면서도 과학적 글쓰기로는 실패할 수 있음.
- 문단 자체는 그럴듯해도 문단 사이의 연결이 성립하지 않는 사례가 있음. 어느 섹션에서도 언급하지 않는 그림, 앞선 근거 없이 등장하는 주장, 인용을 나열할 뿐 서로 연결하지 않는 관련 연구 문단, 하이퍼파라미터가 빽빽한 방법 도식, 논문 어디에도 구체적 예시가 없는 결과 표 등이 이에 해당함.
- Science Slop Index는 이런 단절을 세며, 논문 전체에서 6개 패턴을 3개 평면으로 묶어 분석함. 각 평면의 사례는 사이트에서 분석한 논문의 실제 결과로 확인할 수 있음.
논문 처리 과정
- 모든 보고서에는 나중에 다시 열 수 있는 키가 발급됨. 업로드 파일은 분석 후 삭제되며, 보고서와 렌더링된 그림만 보관됨.
- 읽기: LaTeX 소스는 직접 읽고, arXiv 링크에서는 소스와 PDF를 가져옴. PDF는 섹션, 캡션, 참고문헌, 인용으로 재구성됨.
- 측정: 네 지표는 정확한 계수 규칙을 사용함. 논증 그래프와 그림 설명 지표는 언어 모델을 사용해 문장을 분류하고 방법 그림을 읽음.
- 강조 표시: 표시된 모든 단위를 PDF에 되돌려 배치하고 평면별 색상과 지표별 그래프로 표시함. 강조 표시 PDF, JSON, CSV로 내보낼 수 있음.
여섯 가지 지표
- 논문의 표 1에 소개된 여섯 지표를 사용함.
- 각 점수는 분자와 분모로 계산하는 단위 비율임.
- 쌍별 정확도(pair accuracy)는 SciSlopBench에서 각 지표만으로 인간 작성 논문을 짝지은 AI 생성 논문보다 높게 순위 매긴 빈도임.
하나의 점수
- 지표를 평면별로 평균한 뒤 세 평면의 평균을 산출함.
- 논문에 적용되지 않는 지표는 0점으로 계산하지 않고 건너뜀.
- 낮음·보통·높음·매우 높음의 네 구간은 표시된 단위 비율을 설명하기 위한 기준이며, AI가 작성했을 확률을 뜻하지 않음.
보고된 쌍별 정확도
- 논문 표 2의 결과는 SciSlopBench에서 같은 문제를 다루는 인간 작성 논문과 짝지은 AI 생성 논문 390편을 대상으로 함.
- 0.5는 우연히 맞힐 때의 기준임.
리더보드와 갤러리
- 리더보드는 사이트에서 분석한 논문을 Science Slop Index 점수순으로 정렬함. 점수가 높을수록 과학적 허술함이 많음을 뜻함.
- 각 행을 선택하면 여섯 지표를 확인할 수 있으며, 보고서를 열어 논문의 개별 분석 결과를 볼 수 있음. 단일 지표별 정렬도 제공함.
- 갤러리에는 공개 링크에서 분석한 논문과 소유자가 공개 목록 등록을 선택한 업로드 논문이 표시됨.
- 갤러리 정렬 기준은 지수 높은 순, 낮은 순, 최신순임.
보고서 열기
- 제출 시 받은 보고서 키를 입력해 보고서를 열 수 있음.
- 이 브라우저에서 최근 연 보고서를 확인하거나 다운로드한 JSON 보고서 파일을 열 수 있음.
패턴 제안
- 여섯 지표가 놓친, AI 생성 논문에서 과학적 글쓰기가 무너지는 반복 패턴을 제안할 수 있음.
- 제안자는 패턴의 이름과 독자가 알아차리는 특징을 설명함. 이후 해당 패턴을 구현하고 SciSlopBench에서 실행하며, AI 논문과 인간 논문을 구별하면 제안자의 이름을 붙여 채택함.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요