TL;DR

  • 잠재 정보 피드백 트랜스포머(Latent Information Feedback Transformer, LIFT)는 사전학습 중 심층 표현을 얕은 층에 전달하는 병목을 해소하며, 1억 3,500만~10억 개 매개변수 모델 실험에서 표준 트랜스포머와 기준선보다 여러 과제에서 우수한 성능을 보임.
  • 기존 트랜스포머 언어 모델은 순전파 구조라 생성 단계 사이에 토큰만 정보를 전달하며, 중간 결과를 다시 계산하고 대안적 이어쓰기를 버려야 하는 구조임.
  • LIFT는 사전학습 언어 모델의 다음 토큰 분포에서 도출한 정보 밀도 높은 상태를 교사 신호로 삼아, 다음 토큰과 다음 상태를 함께 예측함.
  • 입력 상태를 미리 계산하므로 위치 간 사전학습은 완전히 병렬화되며, 추론 때 모델 자체의 예측 상태를 되먹임하고 계산 오버헤드는 모델 크기가 커질수록 감소함.
  • 토큰 예산이 같은 조건에서 언어 모델링·추론·절차 과제 성능이 향상됐고, 상태 추적 실험에서는 8배 더 많은 데이터로 학습한 동급 트랜스포머보다 작은 LIFT가 우세함.

논문 개요

  • 논문 제목은 *Pretraining Latent Information Feedback Transformers with Teacher Supervision*이며, Dor Tirosh, Ido Amos, Mor Geva가 작성함.
  • 논문은 2026년 9월 29일 제출됐으며, 분야는 계산과 언어(Computation and Language, cs.CL)임.
  • 인용 정보는 arXiv:2609.38149이며, 논문 DOI로 연결됨.

기존 트랜스포머의 정보 전달 한계

  • 트랜스포머 언어 모델은 순전파 구조로, 깊은 층의 표현이 더 얕은 층에 되돌아가지 않음.
  • 생성 단계 사이에서 정보를 아래 방향으로 전달하는 유일한 경로는 디코딩된 토큰임.
  • 이처럼 좁은 정보 통로 때문에 모델은 중간 결과를 다시 계산하고 대안적 이어쓰기를 버려야 함.

LIFT의 구조와 학습 방식

  • LIFT는 사전학습 중 이 병목을 없애고, 생성 과정에 걸쳐 상태를 전달하는 아키텍처와 학습 방법임.
  • 순환 상태 학습을 교사 강제 예측 문제로 전환함. 각 입력 토큰을 기존 사전학습 언어 모델의 다음 토큰 분포에서 도출한 정보 밀도 높은 상태와 짝지음.
  • 소수의 추가 매개변수로 확장한 모델이 다음 토큰과 다음 상태를 함께 예측하도록 학습함.
  • 입력 상태는 사전 계산되므로 사전학습은 위치 전반에 걸쳐 완전히 병렬로 진행됨.
  • 추론 시에는 모델이 자체 예측 상태를 되먹이며, 이에 따른 계산 오버헤드는 작고 모델 크기가 커질수록 감소함.

실험 결과

  • 매개변수 수 1억 3,500만~10억 개의 사전학습 모델을 평가한 결과, LIFT는 토큰 수를 맞춘 예산에서 언어 모델링, 후속 추론 과제, 절차 과제에 걸쳐 표준 트랜스포머와 기준선보다 일관되게 높은 성능을 보임.
  • 연산량을 맞춘 트랜스포머와 비교하면 LIFT의 성능은 대등하거나 더 높음.
  • 통제된 상태 추적 과제에서 작은 LIFT는 데이터를 8배 더 사용해 학습한 동급 트랜스포머보다 높은 성능을 보임.
  • 이 결과는 해당 과제에 실패하는 트랜스포머가 생성한 상태를 사용해 학습한 경우에도 관찰됨.
  • 연구는 확장 가능한 교사 감독을 통해 언어 모델이 사전학습 중 심층에서 얕은 층으로 전달되는 피드백을 활용하도록 학습할 수 있음을 보임.