TL;DR

  • 단일 가속기 및 소규모 노드처럼 가속기 메모리 용량이 제한된 환경에서 HBFHBM과 함께 대규모 언어 모델(LLM) 가중치 용량 계층으로 활용해 용량 확장형 추론을 지원하는 FLINT 제안임
  • 기존 HBF 기반 방식이 마이크로초 수준 낸드 플래시 읽기 지연을 숨기고 읽기 처리량을 높이기 위해 사용하는 거친 정적 프리페칭의 한계가 핵심 문제임
  • 기존 방식이 리프레시 같은 낸드 플래시 관리 작업을 가속기에서 보이는 추론 임계 경로에 노출하고, 워크로드에 맞춘 플래시 관리 최적화 기회를 놓치는 문제도 존재함
  • 하드웨어 버스트 버퍼 컨트롤러가 HBF 읽기를 동적으로 병합하고 파이프라인화해 기존 낸드 플래시 버퍼를 활용하면서 높은 HBF 대역폭 유지를 목표로 함
  • 팬텀 플레인 리프레시읽기 전용 FTL이 각각 저비용 자원 복제로 리프레시를 백그라운드로 이동하고, 임의 쓰기 지원을 대체하는 압축 테이블로 논리 가중치 버스트와 물리 HBF 위치를 변환함

초록

  • 대규모 언어 모델(LLM) 추론이 계산 처리량보다 가속기 메모리 용량에 의해 점점 더 제약받는 상황임
  • 제한된 온패키지 메모리 용량이 배포 가능한 모델 크기를 제한하는 단일 가속기 및 소규모 노드 추론 시스템에서 이 문제가 특히 심각함
  • HBF(High Bandwidth Flash)는 가속기와 가까운 위치에서 테라바이트급 용량을 제공하는 새로운 3차원 적층 낸드 플래시(3D-stacked NAND flash) 기술로, LLM 가중치를 저장할 유망한 용량 계층임
  • 기존 HBF 기반 제안에는 다음 세 가지 도입 과제가 존재함
  • 마이크로초 수준인 낸드 플래시 장치의 읽기 지연을 숨기면서 HBF 읽기 처리량을 극대화하려고 LLM 가중치에 대한 거친 정적 프리페칭(coarse-grained static prefetching)에 의존함
  • 리프레시 작업 같은 낸드 플래시 관리 작업을 가속기에서 보이는 추론 임계 경로에 노출함
  • 워크로드 동작에 맞춰 플래시 관리 메커니즘을 특화하고 최적화할 기회를 놓침
  • 목표는 HBF를 HBM과 나란히 메모리 용량 계층으로 통합하면서 세 과제를 해결하는 효율적인 HBF 기반을 설계하는 것임
  • 이를 위해 용량 확장형 LLM 추론을 위한 워크로드 기반 HBF 기반 구조인 FLINT를 제안함
  • FLINT가 도입하는 세 가지 메커니즘은 다음과 같음
  • 하드웨어 버스트 버퍼 컨트롤러(hardware burst-buffer controller): 기존 낸드 플래시 버퍼를 활용하면서 높은 HBF 대역폭을 유지하는 것을 목표로 HBF 읽기를 동적으로 병합하고 파이프라인화함
  • 팬텀 플레인 리프레시(phantom-plane refresh): 저비용 자원 복제를 통해 리프레시 관련 낸드 플래시 작업을 읽기 포그라운드 밖으로 이동해 리프레시를 추론 임계 경로에서 제거함
  • 읽기 전용 FTL(read-only FTL): 임의 쓰기를 지원하는 SSD급 기능을 논리 가중치 버스트와 물리 HBF 위치를 변환하는 간결한 테이블로 대체함

논문 정보

  • 분야: 컴퓨터 과학 > 하드웨어 아키텍처
  • 제목: FLINT: Efficiently Leveraging High Bandwidth Flash for Capacity-Scalable LLM Inference Acceleration
  • 저자: Geraldo F. Oliveira, Arash Tavakkol, Xiangyu Zhu, Ahmet Caner Yüzügüler, Vamanan Arulchelvan, Lukas Cavigelli, Renzo Andri, Mohammad Sadrosadati, Jia Xinglei, Onur Mutlu, Zhou Ke, Shai Bergman, Ji Zhang
  • 주제 분류: 하드웨어 아키텍처(Hardware Architecture, cs.AR), 인공지능(Artificial Intelligence, cs.AI), 분산·병렬·클러스터 컴퓨팅(Distributed, Parallel, and Cluster Computing, cs.DC)
  • 인용 정보: arXiv:2608.25062 [cs.AR]
  • 현재 버전 인용 정보: arXiv:2608.25062v1 [cs.AR]
  • 디지털 객체 식별자(DOI): https://doi.org/10.48550/arXiv.2608.25062

제출 이력

  • 최초 제출일: 2026년 8월 25일
  • 제출자: Geraldo Francisco De Oliveira Junior
  • 버전: v1
  • 제출 시각: 2026년 8월 25일 18:58:14 UTC
  • 파일 크기: 2,253KB

전문 링크

  • 논문 제목: FLINT: Efficiently Leveraging High Bandwidth Flash for Capacity-Scalable LLM Inference Acceleration
  • PDF 보기
  • 실험적 HTML 보기
  • TeX 소스 보기
  • 라이선스 보기