TL;DR

  • DeepSeek가 Huawei와 협력해 Ascend 하드웨어에서 최첨단 AI 모델을 학습할 수 있도록 소프트웨어 도구와 생태계를 구축하고, NVIDIA에서 중국산 하드웨어로의 이전 비용과 난도를 낮추려는 움직임임.
  • Ascend용 도구로 TileLang, DeepGEMM, DeepEP, TileKernels, FlashMLA, DeepSelect를 공개함.
  • DeepSeek V4 모델 학습에 쓰이는 TileLang 연산자 대부분이 이미 구현됐으며, 학습에서 사용하는 모든 TileLang 연산자에 Ascend용 고성능 구현이 마련됨.
  • 여러 핵심 테스트에서 연산과 통신 성능이 Ascend 하드웨어의 한계에 근접함.
  • Huawei와 Ascend 950 기반 128카드 슈퍼노드를 공동 개발하며 연산과 칩 간 통신을 함께 최적화함.

DeepSeek와 Huawei, Ascend용 소프트웨어 생태계 구축

  • DeepSeek는 2026년 9월 30일 공식 중국 위챗 계정에 Ascend 컴퓨팅 플랫폼용 기반 소프트웨어 구성요소를 공개한다는 발표를 게시함.
  • 중국 AI 업계가 NVIDIA의 최첨단 GPU에 접근할 수 없을 때의 대안은 Huawei Ascend 칩으로 하드웨어만 교체하는 데 그치지 않음. 중국산 칩을 실제로 쓰기 쉽고 최첨단 AI 모델 학습에 적합하게 만드는 소프트웨어 생태계 구축도 핵심 과제임.
  • 대형 모델 학습에서 NVIDIA의 강점은 GPU뿐 아니라 CUDA를 비롯한 소프트웨어 생태계에도 있음. 이 생태계는 프로그램 작성, 성능 최적화, 수천 개 GPU의 효율적인 연동을 위한 성숙한 도구를 제공함.
  • Huawei Ascend 역시 하드웨어 성능뿐 아니라 사용하기 쉬운 소프트웨어와 칩 성능을 효율적으로 끌어내는 도구가 필요함.
  • DeepSeek는 TileLang, DeepGEMM, DeepEP, FlashMLA 등 저수준 도구를 Ascend용으로 개발함.
  • TileLang은 개발자가 칩에 수행할 작업을 지정하기 쉽게 만드는 고수준 언어임.
  • DeepGEMM은 대형 모델 연산의 핵심인 행렬 연산을 처리함.
  • DeepEP는 학습 중 다수 칩 사이의 고속 통신을 담당함.
  • FlashMLA를 비롯한 구성요소는 어텐션과 데이터 처리 등의 작업을 처리함.
  • 여러 핵심 테스트에서 이 구성요소의 연산 및 통신 성능이 Ascend 하드웨어 자체의 한계에 근접함.
  • 특히 TileLang은 DeepSeek V4 모델 학습에 사용되는 연산자 대부분을 구현하며, DeepSeek 학습에서 현재 사용되는 모든 TileLang 연산자에 Ascend용 고성능 구현을 제공함.
  • DeepSeek가 추진하는 추상화 계층은 모델과 기반 GPU 하드웨어 사이에 놓이는 구조임. 같은 개발 방식이 NVIDIA GPU와 Huawei Ascend 칩 모두에서 작동할 가능성이 있으며, 구현이 잘 이뤄지면 AI 작업 부하를 NVIDIA에서 중국산 AI 하드웨어로 이전하는 비용과 난도가 크게 낮아질 수 있음.
  • Huawei 팀은 개발에 깊이 참여했으며, 양사는 Ascend 950 기반 128카드 슈퍼노드와 연산 및 칩 간 통신의 심층 최적화를 공동으로 진행함. 협력의 초점은 단순한 Ascend 칩 지원을 넘어 최첨단 모델 학습에서 중국산 하드웨어와 소프트웨어를 효율적으로 결합하는 문제임.

Huawei Ascend용 핵심 기반 구성요소 공개

  • DeepSeek는 Huawei Ascend 컴퓨팅 플랫폼을 위한 기반 구성요소를 오픈소스로 공개함. 공개 범위는 TileLang 고수준 언어와 컴파일러 도구 체인, 연산 라이브러리, 분산 통신 라이브러리를 포함하며, 각 구성요소에는 기존에 공개한 NVIDIA 플랫폼용 구성요소에 대응하는 항목이 있음.
  • 독립적이고 제어 가능한 차세대 GPU 소프트웨어 생태계를 구축하려면 범용적이고 프로그래밍이 쉬우며 하드웨어 성능을 한계까지 끌어낼 수 있는 고수준 언어가 우선 필요함. TileLang은 이러한 필요에서 출발함.
  • NVIDIA의 CUDA와 비교할 때 TileLang은 더 단순한 프로그래밍 모델로 개발 효율을 높이고 코드 로직을 간소화함. 비슷한 유형의 다른 고수준 언어와 비교하면 기반 칩의 특성을 충분히 활용해 하드웨어 성능 한계에 도달하도록 설계됨.
  • DeepSeek는 성숙한 NVIDIA 플랫폼에서 먼저 TileLang 방식을 검증함. 현재 DeepSeek V4 모델군 학습 연산자의 대부분을 구현하는 데 쓰이며, 새로운 범용 인공지능(AGI) 패러다임 탐색과 고성능 연산자 개발의 핵심 도구로 활용됨.
  • 이번에 공개한 Ascend용 TileLang은 기반 Ascend C 명령어를 감싸면서도 하드웨어 성능을 희생하지 않는 고수준 프로그래밍 인터페이스를 제공함. DeepSeek 학습에서 현재 사용하는 모든 TileLang 연산자에 Ascend용 고성능 구현을 제공함.
  • Ascend용 TileLang 공개는 더 다양한 AI 칩을 위한 사용성 높은 소프트웨어 생태계를 구축하는 데 참고가 되는 것을 목표로 함.
  • 이번 공개에는 다양한 작업 부하에 재사용할 수 있는 Ascend용 핵심 연산 및 통신 구성요소도 포함됨.
  • DeepGEMM: 일반 행렬 연산 가속
  • DeepEP: 효율적인 대규모 장치 간 통신
  • TileKernels: 데이터 처리를 위한 일반 벡터 연산 및 메모리 접근 연산자
  • FlashMLA: 긴 문맥 처리 효율을 높이는 희소 어텐션 연산자
  • DeepSelect: 효율적인 데이터 선택
  • 여러 핵심 테스트에서 구성요소의 연산 및 통신 성능이 기반 하드웨어의 한계에 근접함.
  • Ascend 플랫폼 개발 전반에서 Huawei 팀이 강력하고 전폭적인 지원을 제공함. 양사는 Ascend 950 기반 128카드 슈퍼노드 솔루션을 함께 개발하고 연산과 통신을 심층 최적화함.
  • DeepSeek는 기술 혁신을 이어가고 커뮤니티와 개방형 소프트웨어 생태계를 구축하며 함께 발전하겠다고 밝힘.

오픈소스 프로젝트