TL;DR

  • AAPR(Absolute-Address Partial Residency)는 학습된 밀집 트랜스포머의 일부 입력 의존 실행 관계를 기록해 재사용할 수 있는지 검증하며, 제한된 채널 검증에서 오라클과 같은 최상위 결과를 재현함.
  • 추론 중 모델 가중치와 아키텍처, 학습된 상태 전이 함수는 고정되지만 실제 활성값은 입력에 따라 달라짐.
  • 학습된 밀집 트랜스포머의 모든 대상 채널에 사후 식별자를 부여하고, 여러 입력에서 활성 이력을 기록해 이전 활성 주소를 키로 하는 정적 전이 매핑을 구성함.
  • NF4 4비트 Gemma 3 4B 환경에서 계층별 MLP down_proj 출력 채널 2,560개 중 80개를 사용해 두 개의 시드와 12개 홉에 걸쳐 여러 작업 범주에서 오라클과 같은 최상위 결과를 재현함.
  • 보정 범위를 늘려 fact_geo 실패를 복구했으며, 선택 행만 계산하는 방식과 원래 L1-12 down_proj 가중치 일부를 VRAM에서 해제한 뒤에도 검증 답변을 보존함.

설명

  • 캐시, 메모이제이션, 조회 테이블은 정보가 여전히 유효하고 해당 객체를 다시 식별할 수 있을 때 이전에 계산한 정보를 재사용함. 이 원리 자체는 새롭지 않으며, 이 기록의 기여라고 주장하지 않음.
  • 제안 구조를 절대 주소 부분 상주(Absolute-Address Partial Residency, AAPR)라고 부름. AAPR은 학습된 밀집 트랜스포머의 실행 관계에도 같은 원리를 적용할 수 있는지 묻는 구조임.
  • 학습 후 추론 중에는 모델 가중치와 아키텍처, 내부 상태에서 다음 상태로 이어지는 학습된 함수가 고정되지만 실제 활성값은 입력에 따라 달라짐. 따라서 학습된 모델의 불변성만으로 실행 경로를 재사용할 수 있다고 볼 수 없으며, 입력 의존 실행 관계를 관찰·기록한 뒤 나중에 재사용할 수 있는지 별도로 검증해야 함.
  • 검증을 위해 학습된 밀집 트랜스포머의 모든 대상 채널에 사후 식별자를 부여함. 변경하지 않은 모델에 여러 입력을 통과시키면서 활성 이력을 기록하고, 이전 활성 주소를 키로 삼는 정적 전이 매핑을 구성함.
  • NF4 4비트 Gemma 3 4B 환경에서 계층별 MLP down_proj 출력 채널 2,560개 중 80개를 사용한 폐쇄형 작업 검증을 수행함. 두 개의 시드와 12개 홉, 여러 작업 범주에서 매 홉마다 실제 잔차를 참조하는 오라클과 동일한 최상위 결과를 재현함.
  • 보정 범위가 부족해 fact_geo 실패가 발생했으나, 사실 유형 예시를 추가하고 전이 매핑만 다시 구축한 뒤 복구함.
  • 선택된 행만 실제 계산하는 경로는 전체 계산 후 마스킹으로 같은 행만 남기는 경로와 일치함.
  • 원래 L1-12 down_proj 가중치 일부를 VRAM에서 물리적으로 해제한 뒤에도 검증 답변을 보존함.

파일

  • AAPR_Dated_Technical_Record_v1_English.pdf — 190.7 kB, MD5: d273514a33b820111e14e8b5fdc5f2b5