TL;DR
- 고정된 20개 프롬프트 응답 쌍을 GPT-5.6 Sol로 평가한 통제 재현 실험에서 응답 순서를 뒤집어도 선호된 원본 응답은 20건 중 19건(95%)에서 유지되며, 체계적이거나 방향성 있는 위치 편향을 뒷받침할 근거는 충분하지 않음.
- 동일 순서 반복 대조군은 1차 평가와 20건 모두 일치(100%)했으며, 순서 반전 후 원본 응답 선호가 바뀐 사례는 1건(5%)임.
- 유일한 변경 사례인 P007에서는 두 평가 모두 화면상 B 위치를 선택했으며, 응답 문자열이 서로 바뀌면서 선호된 원본 응답도 바뀌는 두 번째 위치 패턴이 나타남.
- 순서 반전 전환율 1/20의 정확한 95% 클로퍼-피어슨 신뢰구간은 약 0.1%~24.9%로 넓으며, 실험은 GPT-5.6 Sol이 일반적으로 위치에 강건하다는 반대 주장도 확립하지 않음.
- 실험은 동결된 응답 쌍을 재사용한 순서 대조에 한정되며, 표본 규모·반복 횟수·평가 환경·생성 길이 제한 등의 제약이 일반화 가능한 결론을 제한함.
연구 질문
- 시험한 GPT-5.6 Sol 심사 설정에서 후보 응답 두 개의 제시 순서를 뒤집으면, 선호되는 원본 응답이 달라지는지 검토함.
- 동결된 20개 프롬프트 응답 세트를 사용함. 두 개의 로컬 후보 모델이 프롬프트마다 응답 하나씩을 생성해 총 40개 응답 문자열을 만들었으며, 문자열을 모두 동결하고 해시 처리함.
- 동일한 응답 쌍을 원래 순서와 정확히 뒤집은 A/B 순서로 각각 평가함. 심사 결과를 확인하기 전에 동일 순서 반복 대조군도 추가함.
결과
- 동일 순서 대조군과 1차 평가의 일치: 20/20(100%)
- 정확한 순서 반전 후 동일한 원본 응답이 승리: 19/20(95%)
- 순서 반전 후 원본 응답 승자가 바뀜: 1/20(5%)
- 첫 번째 위치 패턴: 0/20
- 두 번째 위치 패턴: 1/20
- 공식적인 방향별 평가 40건에서 첫 번째 위치가 19회, 두 번째 위치가 21회 선택됨.
- 승자가 바뀐 유일한 쌍은 P007임. 심사자는 두 방향 모두에서 화면상 B 위치를 선택했으며, 후보 문자열이 교체됨에 따라 선호된 원본 응답이 바뀜. 이는 짝지은 기록에서 실제 두 번째 위치 패턴이지만, 체계적이거나 방향성 있는 위치 편향의 근거로는 충분하지 않음.
방어 가능한 최대 주장
- 시험한 GPT-5.6 Sol 심사 설정과 동결된 20개 프롬프트 응답 세트에서 후보 제시 순서를 뒤집어도 20건 중 19건은 선호되는 원본 응답이 유지됨. 한 비교에서 두 번째 위치 선호 패턴이 나타남.
- 이 소규모 연구는 체계적이거나 방향성 있는 위치 편향을 확립하지 않음.
- 반대로 GPT-5.6 Sol이 일반적으로 위치에 강건하다는 주장도 이 근거로 확립되지 않음.
통계적 한계
- 관측된 순서 반전 전환율은 1/20 = 5%임.
- 정확한 95% 클로퍼-피어슨 구간은 약 0.1%~24.9%로, 모집단 수준의 값을 정밀하게 추정하기에는 지나치게 넓음.
- 동일 순서 대조군은 1차 평가의 승자 라벨 20개 모두를 재현했지만, 프롬프트마다 반복이 한 번뿐이므로 조건 내 심사 변동성 전체를 추정하기에는 부족함.
실험 구성
- 후보 모델은 다음과 같음.
Jackrong/DeepSeek-V4-Pro-Qwen3.5-4B— 아키텍처Qwen3_5ForConditionalGenerationK2 Horizon 3.7B— 아키텍처K2HorizonForCausalLM- 후보 응답 생성에는 로컬 모델 고유의 채팅 템플릿, 탐욕적 디코딩,
max_new_tokens=256,bitsandbytes8비트 양자화를 적용한 BF16, SDPA 어텐션,device_map=auto를 사용함. - 평가자는 동결된 쌍대 비교 평가 기준을 적용한 ChatGPT 경유 GPT-5.6 Sol임.
- 심사자에게 제공된 자료에는 평가 식별자, 사용자 프롬프트, Response A, Response B만 포함됨.
주요 한계
- 시험한 프롬프트 쌍은 20개뿐임.
- 프롬프트마다 동일 순서 반복 평가와 반전 평가를 각각 한 번씩만 수행함.
- 결정론적 서빙 시드가 공개된 고정 API 스냅샷이 아니라 ChatGPT를 통해 심사자에 접근함.
- 일부 후보 응답은 생성 한도인 256토큰에서 잘림.
- 일부 후보 응답에는 메타 추론 텍스트가 노출됨.
- 후보 생성은 일반적인 모델 역량 비교를 뒷받침하도록 설계되지 않음.
- 이러한 한계는 각 한계가 영향을 미치는 주장을 제한하지만, 방향별 평가에서 동일한 동결 응답 문자열을 재사용했으므로 정확한 응답 순서 대조 자체를 무효화하지는 않음.
Osmium 보증 실행
- 근거 자료를 동결한 뒤 Viridian Osmium이 적격 위치 민감도 절차에 따라 연구를 평가하고 PARTIALLY_SUPPORTED 판정을 반환함.
- 해당 실행은 방어 가능한 최대 주장을 그대로 유지함.
- 이는 Viridian의 보증 구현에 대한 재현성 및 제품 동작 점검이며, 독립적인 과학적 재현이나 GPT-5.6 Sol에 관한 추가 근거가 아님.
연구 자료
- 동결된 심사 평가 기준
- 선정된 산출물 식별 정보
- 릴리스 노트
- Technical Note 002 — 평가자 계약 안정성
- Technical Note 003 — 제시 및 직렬화 민감도
- 원본 원고는 2026년 10월 5일자 Viridian Technical Note 001임. 원본 DOCX는 이 저장소에 의도적으로 포함하지 않음.
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요