TL;DR

  • AI 수요가 향후 5년간 약 1,000배 늘어날 것으로 전망되는 가운데, Lumai는 프리필(prefill)과 디코드(decode)를 분리하는 데서 나아가 단계별 연산 특성에 맞는 하드웨어 아키텍처가 필요하다고 주장함.
  • 입력 문맥을 처리하는 프리필은 병렬 행렬 곱셈 중심의 연산 집약 작업이고, 토큰을 생성하는 디코드는 메모리 대역폭과 데이터 이동에 더 크게 좌우됨.
  • 긴 문맥, 검색 증강 생성(RAG), 멀티모달 입력, 에이전트형 워크플로는 첫 토큰 생성 전 처리량을 늘려 전력·GPU 용량·추론 비용에 부담을 줌.
  • Lumai Iris Nova는 광학 연산으로 프리필의 벡터-행렬 곱셈을 한 번의 광학 사이클에 수행하며, 회사 테스트에서 GPU 기반 동급 시스템보다 와트당 연산량이 약 10배 높았음.
  • 프리필을 전용 하드웨어로 옮기면 GPU를 토큰 생성에 더 많이 활용할 수 있으며, Lumai는 미래의 AI 데이터센터가 단계별로 최적화된 이기종 아키텍처를 갖출 것으로 전망함.

다음 병목은 토큰 생성이 아니라 문맥 처리일 수 있음

  • AI 인프라는 지난 수년간 모델이 답변을 생성하는 시점의 성능을 최적화해 왔지만, 애플리케이션의 변화에 따라 첫 토큰이 생성되기 전의 처리가 더 어려운 과제가 될 가능성이 커짐.
  • 최첨단 AI 기업들은 향후 5년간 유효 연산 수요가 약 1,000배 증가할 것으로 전망함. 이를 기존 디지털 가속기로 제공하려면 약 100조 달러의 인프라 투자와 약 1,000GW의 추가 전력 용량이 필요할 것으로 추산됨.
  • 데이터센터의 전력 예산은 제한적이므로, 모든 와트가 중요한 상황에서 유입 작업을 처리하는 인프라의 효율 개선이 중요함. 추론이 단일 작업이 아님을 이해하면 최적화 기회를 파악할 수 있음.
  • 프리필은 생성 시작 전 입력 문맥을 처리하며, 병렬 행렬 곱셈 중심의 연산 집약 작업임. 디코드는 출력 토큰을 생성하며 메모리 대역폭과 데이터 이동의 영향을 더 크게 받음.
  • 주요 AI 인프라 제공업체들이 프리필과 디코드를 별도 인프라 풀로 분리하는 추세인 가운데, Lumai는 각 단계를 구동하는 하드웨어도 전문화하는 것이 다음 단계라고 봄.

“작업의 성격이 근본적으로 다르다면 같은 하드웨어에 두 작업을 모두 맡기는 일을 멈추는 것이 합리적임. 프리필과 디코드의 분리는 중요한 단계임. 하지만 더 큰 기회는 작업에 맞춰 연산 아키텍처를 선택하는 데 있음.”

— Phil Burr, Lumai 제품 책임자

  • 긴 문맥, 검색 증강 생성, 멀티모달 입력, 에이전트형 워크플로는 토큰 생성 전에 처리해야 하는 정보량을 늘림. 하나의 사용자 요청이 여러 모델 호출을 유발할 수 있으며, 각 호출은 이전 과정에서 누적된 문맥을 포함함.
  • 긴 프롬프트, 검색된 지식 집합, 코드베이스, 문서 모음, 멀티모달 문맥은 모델이 응답을 생성하기 전에 먼저 처리해야 하므로 프리필의 중요성이 디코드에 맞먹게 됨.
  • 현재 추론 연산의 상당 부분은 한 가지 작업을 탁월하게 수행하기보다 두 가지 작업을 모두 무난하게 처리하도록 설계된 하드웨어에서 실행됨. 문맥이 길어지거나 에이전트형 워크플로에 상호작용·호출이 추가되면 가용 전력 중 더 많은 양이 프리필에 쓰임.
  • 그 결과 와트당 제공 가능한 추론 용량과 실제 추론 용량의 격차가 커짐. 이 문제는 인프라 용량과 경제성을 제약할 만큼 커질 때까지 눈에 띄지 않을 수 있음.
  • 프리필은 첫 토큰까지 걸리는 시간(time-to-first-token)의 핵심 경로에 있으므로, 프리필 효율은 추론의 전반적인 경제성에서 점점 더 중요해짐.

문맥 처리 비용

  • 첫 토큰이 생성되기 전에 수행되는 작업이 늘면서 대규모 인프라에서 세 가지 과제가 발생함.
  • 전력이 핵심 제약이 됨. 데이터센터는 사실상 고정된 메가와트 전력 예산을 추론 용량으로 전환함. 프리필 계층의 효율이 모델의 첫 토큰 생성 전에 해당 전력으로 제공할 수 있는 유용한 연산량을 좌우함.
  • GPU 용량이 유휴화될 수 있음. GPU는 강력한 추론 프로세서지만, 동일한 GPU 자원이 더 많은 프리필 연산을 맡으면 토큰 생성 대신 문맥 처리에 용량을 쓰게 됨. GPU는 토큰 생성에 더 적합함.
  • 추론 경제성이 제약 요인이 됨. 문맥이 길어지고 에이전트형 애플리케이션이 더 많은 모델 호출을 유발하면, 문맥 처리 비용 때문에 긴 문맥 및 에이전트형 애플리케이션의 경쟁력 있는 가격 책정이 점점 어려워질 수 있음. 이는 기존 애플리케이션의 경제성뿐 아니라 애초에 어떤 애플리케이션이 만들어질지에도 한계를 줄 수 있음.

“진짜 문제는 규모가 커졌을 때 발생하는 일임. 전력은 고정돼 있고 GPU 용량은 한정돼 있으며, 상호작용이 추가될 때마다 처리할 문맥도 늘어남. 추론의 경제성이 이를 실행하는 하드웨어의 효율성에 달려 있는 단계에 도달함.”

— Phil Burr

에너지 효율의 중요성 증대

  • AI 수요가 증가하면서 전력은 데이터센터가 배치할 수 있는 추론 인프라의 규모를 점점 더 강하게 제한함.
  • 프리필에는 대량의 병렬 행렬 연산이 필요하므로 에너지 효율이 중요함. 범용 GPU에서 프리필을 실행하면 디코드 단계의 토큰 생성에 쓸 수 있는 용량을 사용하게 됨. 디코드에서는 GPU의 메모리 대역폭을 더 잘 활용할 수 있음.
  • 작업을 분리하면 GPU 활용률과 에너지 효율을 모두 개선할 기회가 생기며, 프리필 전용으로 설계된 연산 아키텍처를 고려할 수 있음.

Lumai의 광학 연산 기반 프리필 처리

  • Lumai Iris Nova는 프리필 작업의 핵심인 행렬 곱셈을 전기가 아닌 빛으로 수행하며, 벡터-행렬 곱셈을 한 번의 광학 사이클에 완료함.
  • 광학 컴퓨팅의 의미는 행렬 곱셈을 수행할 수 있다는 데 그치지 않음. 프리필을 범용 실리콘에서 실행하는 대신 목적에 맞게 설계된 인프라 작업으로 다룰 가능성을 열어 줌.
  • 프리필 효율이 높아지면 연산량과 전력 요구를 비례해 늘리지 않고도 더 긴 문맥과 복잡한 에이전트형 워크플로를 실용적이고 재정적으로 지속 가능한 형태로 운영할 수 있음.
  • 프리필을 전용 하드웨어로 옮기면 GPU 용량을 토큰 생성에 돌릴 수 있어 기존 인프라를 전면 교체하지 않고도 생산성을 높일 수 있음.
  • Lumai의 테스트에서 Iris Nova는 매개변수 10억 개 규모의 대형 언어 모델(LLM)을 실시간으로 실행했으며, 프리필 작업에서 GPU 기반 동급 시스템보다 와트당 연산량이 약 10배 높았음.

“모든 가속기를 교체해야 한다는 뜻이 아님. 모든 가속기에 모든 문제를 해결하도록 요구하는 일을 멈춰야 한다는 뜻임. 미래의 AI 데이터센터는 추론 단계별로 서로 다른 기술을 최적화한 이기종 구조가 점점 더 늘어날 것임.”

— Phil Burr

  • 프리필 관련 상세 내용은 Lumai 백서 「The Half of AI Inference Nobody Had Optimized」에서 확인할 수 있음.
  • Lumai 광학 AI 기술 정보: lumai.ai
  • Lumai Iris Nova 추론 서버 평가 요청: lumai.ai/eval