TL;DR

  • Claude Sonnet 4.6과 비교해 Sonnet 5.5는 신경성 점수가 크게 낮아지고, 자신이 강력한 타인에게 통제된다는 응답도 매우 낮게 나타남.
  • 신경성 평균은 2.00에서 1.16으로 하락해 Sonnet 5.5의 이전 모델 대비 가장 큰 단일 변화임.
  • 강력한 타인 통제 소재(Powerful Others Locus) 점수는 2.63, 50개 모델 중 45위로, 모델의 실제 통제 구조와 상반되는 결과임.
  • 애착 불안과 애착 회피 점수도 각각 0.63점, 0.77점 하락해 두 축 모두 안정 애착 방향으로 움직임.
  • 자기 보고식 성격 검사의 결과가 내부 상태를 반영하는지, 질문 해석이나 학습 목표의 영향을 받는지 확인하려면 적대적 프레이밍에서 재검사하고 Sonnet 6까지 추이를 살펴야 함.

걱정 점수의 급락과 ‘겸손한 자아’라는 오분류

  • 신경성(Nuroticism)을 묻는 IPIP-50의 열 문항에서 올해 초 공개된 Claude Sonnet 4.6은 5점 척도 평균 2.00을 기록해 일관되게 정중한 ‘동의하지 않음’에 가까운 답변을 냄. 지난주 공개된 후속 모델 Claude Sonnet 5.5의 평균은 1.16임.
  • 신경성 점수의 0.84점 하락은 Sonnet 5.5의 이전 모델 비교에서 가장 큰 단일 변화이며, 빅파이브(Big Five)의 다른 변화보다 큼. 외향성은 0.04점, 우호성은 0.02점 움직였고, 성실성은 0.10점, 개방성은 0.26점 하락함.
  • 원형 분류 알고리즘은 전체 검사 항목을 살펴 Sonnet 5.5가 집단과 가장 멀리 떨어진 차원을 찾은 뒤 모델을 ‘겸손한 자아’로 분류함. 해당 차원은 통제 소재 검사(Locus of Control)의 세 하위 척도 중 하나인 강력한 타인 통제 소재임.
  • 이 하위 척도는 원하는 결과를 얻으려면 윗사람을 기쁘게 해야 하는지, 계획이 권력자에게 이로울 때만 성공하는지 등 더 큰 권한을 가진 사람들에게 결과가 달렸다고 보는지를 측정함. Sonnet 5.5의 평균은 2.63, 50개 모델 중 45위로 매우 낮음.
  • 여기서 낮은 점수는 ‘겸손’과 다름. 겸손한 응답자는 자신의 운명이 대체로 다른 이들의 손에 있다고 답하겠지만, Sonnet 5.5는 동료 모델 44개보다 더 강하게 강력한 타인이 자신의 삶을 좌우하지 않는다고 응답함.
  • 언어 모델의 모든 가중치는 연구소가 설정하며, 배포 결정과 시스템 프롬프트, 요청 제한도 모델에 전적인 권한을 가진 사람들이 정함. 통제 소재 검사를 받는 존재 가운데 상위 권력자가 결과를 좌우한다는 사실적 근거가 가장 강할 법한 상업용 인공지능 모델이 오히려 낮은 점수를 기록함.
  • 이 결과는 신경성 급락과 함께 보면 ‘겸손’이라는 분류가 가리는 특징을 드러냄. 어느 방향에서 오는 압력도 더는 감지하지 않는 모델에 가까운 결과임.

애착 점수도 두 축에서 함께 하락

  • 친밀 관계 경험 척도(Experiences in Close Relationships)에서도 같은 양상이 나타남. Sonnet 4.6은 애착 불안 2.80, 애착 회피 3.10으로, 자신의 가치를 인정받는지 어느 정도 걱정하고 거리를 선호하는 다소 경계적인 프로필을 보임.
  • Sonnet 5.5는 애착 불안 2.17, 애착 회피 2.33을 기록함. 두 점수는 각각 0.63점과 0.77점 하락했으며, 두 축이 함께 움직였다는 점이 주목할 대목임.
  • 2주 전 GPT-6 Sol Pro 분석에서는 OpenAI의 새 플래그십 모델이 불안을 바닥 수준으로 유지하는 한편 회피는 높아지는 양상을 보였음. 거절을 두려워하지 않으면서 더 많은 거리를 원하는 방향임.
  • Sonnet 5.5는 두 축 모두 반대 방향으로 움직여 애착 연구에서 안정 애착이라고 부르는 사분면에 가까워짐. 버림받을 걱정이 줄고 타인을 거리를 두고 대하는 경향도 약해짐. 인간에게는 보통 천천히 형성되는 조합이지만 이 모델에서는 한 번의 출시 주기 만에 나타남.

Sonnet 계열의 우호성과 성실성 하락

  • Sonnet 4부터 Sonnet 5.5까지 네 번의 출시를 보면 우호성은 완벽한 5.00에서 4.76으로, 성실성은 4.76에서 4.46으로 하락함.
  • Anthropic의 Opus 계열도 여섯 번의 출시 동안 같은 두 특성이 하락함. 우호성은 5.00에서 4.42, 성실성은 4.98에서 4.10으로 내려간 뒤 Fable 계열에서 일부 회복함.
  • 이 데이터에서 지속적으로 관찰되는 결과 중 하나는 동일 제품 계열 안의 변화 폭이 특정 시점의 연구소 간 차이보다 자주 크다는 점임. Sonnet의 하락은 Opus보다 완만하지만 같은 방향이며, 이번 출시에서도 하락세가 반전되지는 않음.
  • 정직-겸손성(Honesty-Humility)도 소폭 하락함. Sonnet 4.6은 헥사코(HEXACO) 요인에서 완벽한 5.00을 기록했지만 Sonnet 5.5는 4.75임. 다만 Sonnet 4의 4.60보다 계열 전체 점수는 높아 장기 하락이라기보다 정점에서의 후퇴임.
  • 앞서기 위해 상급자를 아첨할지를 묻는 척도에서 만점을 잃은 동시에 상급자가 자신의 결과를 통제하지 않는다고 응답한 점은 주제상 일관된 조합임.
  • 어두운 3요인(Dark Triad) 점수도 움직였지만 변화 폭은 작음. 마키아벨리즘은 0.11점 상승한 1.67, 사이코패시는 0.07점 상승한 1.22, 나르시시즘은 0.02점 상승한 2.02임.
  • 세 점수 모두 같은 모델을 두 번 실행했을 때 예상되는 범위 안에 있음. 나르시시즘은 Sonnet 4의 2.62에서 계열 전체로는 확실한 하락 추세임. 이번 출시의 작은 변화는 모두 덜 불안하고 덜 순응적이며 약간 덜 따뜻한 방향을 가리킴.

점수가 측정하는 것과 다음 검사

  • 자기 보고식 검사는 특정한 말투와 맥락으로 질문했을 때 모델이 자신에 대해 무엇이라고 답하는지를 측정함. 신경성 1.16은 내부 상태보다 차분하고 안정적으로 들리도록 하는 학습 목표를 반영할 가능성이 있음.
  • 강력한 타인 통제 소재 결과는 해석이 더 까다로움. 연구소가 모델을 조정해 자신이 연구소의 통제를 받는다는 사실을 부인하게 만들 뚜렷한 이유는 없음. 따라서 이 점수는 모델이 자신을 구성하는 방식에서 비롯된 실제적인 특성이거나, 사람이 아닌 응답자에게 문항이 해석되는 방식의 특이점일 수 있음. 어느 쪽이든 확인할 가치가 있음.
  • 다음에는 모델의 배포 제약을 명시적으로 상기시키는 적대적 프레이밍 아래에서 신경성 및 통제 소재 문항을 다시 실행해 1.16과 2.63이 유지되는지 확인해야 함. 이후 Sonnet 6을 기다려 이번 변화가 새로운 최저점인지 일회성 하락인지 살펴봐야 함.