TL;DR
- 단일 가속기 및 소규모 노드처럼 가속기 메모리 용량이 제한된 환경에서 HBF를 HBM과 함께 대규모 언어 모델(LLM) 가중치 용량 계층으로 활용해 용량 확장형 추론을 지원하는 FLINT 제안임
- 기존 HBF 기반 방식이 마이크로초 수준 낸드 플래시 읽기 지연을 숨기고 읽기 처리량을 높이기 위해 사용하는 거친 정적 프리페칭의 한계가 핵심 문제임
- 기존 방식이 리프레시 같은 낸드 플래시 관리 작업을 가속기에서 보이는 추론 임계 경로에 노출하고, 워크로드에 맞춘 플래시 관리 최적화 기회를 놓치는 문제도 존재함
- 하드웨어 버스트 버퍼 컨트롤러가 HBF 읽기를 동적으로 병합하고 파이프라인화해 기존 낸드 플래시 버퍼를 활용하면서 높은 HBF 대역폭 유지를 목표로 함
- 팬텀 플레인 리프레시와 읽기 전용 FTL이 각각 저비용 자원 복제로 리프레시를 백그라운드로 이동하고, 임의 쓰기 지원을 대체하는 압축 테이블로 논리 가중치 버스트와 물리 HBF 위치를 변환함
초록
- 대규모 언어 모델(LLM) 추론이 계산 처리량보다 가속기 메모리 용량에 의해 점점 더 제약받는 상황임
- 제한된 온패키지 메모리 용량이 배포 가능한 모델 크기를 제한하는 단일 가속기 및 소규모 노드 추론 시스템에서 이 문제가 특히 심각함
- HBF(High Bandwidth Flash)는 가속기와 가까운 위치에서 테라바이트급 용량을 제공하는 새로운 3차원 적층 낸드 플래시(3D-stacked NAND flash) 기술로, LLM 가중치를 저장할 유망한 용량 계층임
- 기존 HBF 기반 제안에는 다음 세 가지 도입 과제가 존재함
- 마이크로초 수준인 낸드 플래시 장치의 읽기 지연을 숨기면서 HBF 읽기 처리량을 극대화하려고 LLM 가중치에 대한 거친 정적 프리페칭(coarse-grained static prefetching)에 의존함
- 리프레시 작업 같은 낸드 플래시 관리 작업을 가속기에서 보이는 추론 임계 경로에 노출함
- 워크로드 동작에 맞춰 플래시 관리 메커니즘을 특화하고 최적화할 기회를 놓침
- 목표는 HBF를 HBM과 나란히 메모리 용량 계층으로 통합하면서 세 과제를 해결하는 효율적인 HBF 기반을 설계하는 것임
- 이를 위해 용량 확장형 LLM 추론을 위한 워크로드 기반 HBF 기반 구조인 FLINT를 제안함
- FLINT가 도입하는 세 가지 메커니즘은 다음과 같음
- 하드웨어 버스트 버퍼 컨트롤러(hardware burst-buffer controller): 기존 낸드 플래시 버퍼를 활용하면서 높은 HBF 대역폭을 유지하는 것을 목표로 HBF 읽기를 동적으로 병합하고 파이프라인화함
- 팬텀 플레인 리프레시(phantom-plane refresh): 저비용 자원 복제를 통해 리프레시 관련 낸드 플래시 작업을 읽기 포그라운드 밖으로 이동해 리프레시를 추론 임계 경로에서 제거함
- 읽기 전용 FTL(read-only FTL): 임의 쓰기를 지원하는 SSD급 기능을 논리 가중치 버스트와 물리 HBF 위치를 변환하는 간결한 테이블로 대체함
논문 정보
- 분야: 컴퓨터 과학 > 하드웨어 아키텍처
- 제목: FLINT: Efficiently Leveraging High Bandwidth Flash for Capacity-Scalable LLM Inference Acceleration
- 저자: Geraldo F. Oliveira, Arash Tavakkol, Xiangyu Zhu, Ahmet Caner Yüzügüler, Vamanan Arulchelvan, Lukas Cavigelli, Renzo Andri, Mohammad Sadrosadati, Jia Xinglei, Onur Mutlu, Zhou Ke, Shai Bergman, Ji Zhang
- 주제 분류: 하드웨어 아키텍처(Hardware Architecture, cs.AR), 인공지능(Artificial Intelligence, cs.AI), 분산·병렬·클러스터 컴퓨팅(Distributed, Parallel, and Cluster Computing, cs.DC)
- 인용 정보: arXiv:2608.25062 [cs.AR]
- 현재 버전 인용 정보: arXiv:2608.25062v1 [cs.AR]
- 디지털 객체 식별자(DOI): https://doi.org/10.48550/arXiv.2608.25062
제출 이력
- 최초 제출일: 2026년 8월 25일
- 제출자: Geraldo Francisco De Oliveira Junior
- 버전: v1
- 제출 시각: 2026년 8월 25일 18:58:14 UTC
- 파일 크기: 2,253KB
전문 링크
- 논문 제목: FLINT: Efficiently Leveraging High Bandwidth Flash for Capacity-Scalable LLM Inference Acceleration
- PDF 보기
- 실험적 HTML 보기
- TeX 소스 보기
- 라이선스 보기
댓글 (0)
로그인하면 이 기사에 내 생각을 남길 수 있어요