TL;DR

  • H-HPU는 노드 1,024개의 2차원 격자(Grid) 기준 아키텍처와 비교해 계층적·관계형 워크로드에서 육각형 네트워크 온칩(NoC)과 폐루프 제어를 적용하며, 평균 지연 시간을 53.7% 줄임.
  • H6-NoC + H-MEM은 네트워크 직경을 62.0홉에서 36.0홉으로 낮추고, 이분 대역폭을 31.6개에서 73.0개 링크로 높임.
  • 평균 홉 수는 7.70에서 7.66으로 거의 변하지 않지만, 라우터 큐 경합 감소로 평균 지연 시간이 21.4사이클에서 9.9사이클로 줄어듦.
  • 포화 처리량은 0.10에서 0.143 flit/사이클로 증가하고, HARC 폐루프 제어는 메모리 압력 U_M ≈ 0.932를 포화 이하로 유지함.
  • H-MESI의 6개 이웃 방향 마스크는 캐시 무효화 트래픽을 로컬 클러스터로 제한해 쓰기당 일관성 메시지를 1,026개에서 3.2개로 줄임.

H-HPU

  • 계산 가속 플랫폼(PAC)인 H-HPU의 벤치마크 및 시뮬레이션 결과를 제시하며, 검증 버전은 v0.4/v0.5임.
  • 계층적·관계형 워크로드와 트래픽 패턴 O(N log N)에서 N = 1,024개 노드의 표준 2차원 격자(Grid) 기준 아키텍처와 H-HPU를 평가함.

벤치마크 및 시뮬레이션 결과

  • 네트워크 직경: 2차원 격자 기준 62.0홉, H-HPU 36.0홉, 변화 -41.9%임. 주요 요인은 토폴로지 방정식과의 부합이며, 여유율은 1.5%임.
  • 이분 대역폭: 기준 31.6개 링크, H-HPU 73.0개 링크, 변화 +130.9%임. 주요 요인은 d ≤ 6인 평면 육각형 연결 구조임.
  • 평균 홉 수: 기준 7.70홉, H-HPU 7.66홉, 변화는 약 0%임. 계층적 워크로드의 공간적 지역성이 높은 것이 주요 요인임.
  • 평균 지연 시간: 기준 21.4사이클, H-HPU 9.9사이클, 변화 -53.7%임. 주요 요인은 라우터 큐 경합의 대폭 감소임.
  • 포화 처리량: 기준 0.10 flit/사이클, H-HPU 0.143 flit/사이클, 변화 +43.0%임. 격자는 조기에 포화되며 H6는 주입 트래픽을 흡수함.
  • 메모리 압력(U_M): 기준 1.034(포화), H-HPU 0.932(안정), 변화 -9.8%임. 주요 요인은 a ≈ 0.10인 HARC 폐루프 제어임.
  • 일관성 오버헤드: 기준 쓰기당 1,026개 메시지, H-HPU 3.2개 메시지, 변화 -99.7%임. 주요 요인은 H-MESI의 6개 이웃 방향 마스크임.

주요 아키텍처 결론

  • 홉 수보다 처리량 우선: 지역화된 트래픽 시나리오에서 지연 시간은 53.7% 감소함. 패킷이 이동하는 홉 수가 줄어서가 아니라, 2.3배 큰 이분 대역폭이 주입률 0.10 초과에서 큐 버퍼 포화를 방지하기 때문임.
  • HARC 안정성: HARC 컨트롤러는 U_M ≈ 0.932로 수렴해 메모리 압력을 포화보다 엄격히 낮은 수준으로 유지하며, 일관성 경쟁 조건이나 교착 상태를 유발하지 않음.
  • 방향성 무효화: H-MESI는 캐시 무효화 트래픽을 6개 이웃 클러스터로 엄격히 제한하며, 전역 브로드캐스트를 로컬 방향성 업데이트로 대체함.