HBM이란? AI GPU 필수 메모리 정리
AI GPU 이야기를 하다 보면 빠지지 않는 단어가 HBM입니다. 엔비디아 GPU 가격의 상당 부분이 이 HBM이고, 한때 GPU 공급 부족의 진짜 원인도 HBM이었습니다. HBM이 무엇이고 왜 AI GPU의 핵심이 됐는지 정리했습니다.
HBM이란?
HBM(High Bandwidth Memory, 고대역폭 메모리)은 여러 개의 메모리 칩을 수직으로 쌓아 올려, 한 번에 훨씬 많은 데이터를 주고받도록 만든 GPU용 메모리입니다.
일반 PC 메모리(DDR)가 기판 위에 평평하게 나열된다면, HBM은 여러 DRAM 칩을 3D로 적층하고 실리콘 관통 전극(TSV)으로 연결합니다. 이렇게 하면 데이터가 오가는 통로(인터페이스)가 훨씬 넓어져, 같은 시간에 더 많은 데이터를 옮길 수 있습니다.
즉 HBM의 핵심은 대역폭(bandwidth), 다시 말해 "데이터를 얼마나 빠르게 많이 나를 수 있는가"입니다.
왜 AI GPU에 HBM이 필수일까
LLM 추론은 흔히 메모리 바운드(memory-bound) 작업이라고 합니다. 무슨 뜻일까요?
토큰을 하나 생성할 때마다 GPU는 모델의 가중치를 메모리에서 읽어와야 합니다. 이 "읽어오는 속도"가 곧 생성 속도를 결정합니다. 즉 LLM의 속도(초당 토큰 수)는 GPU의 연산 능력(FLOPS)보다 메모리 대역폭에 더 크게 좌우됩니다.
그래서 AI GPU에서는 연산 코어만큼이나 HBM이 중요합니다. 아무리 빠른 연산 유닛이 있어도, 가중치를 제때 공급하지 못하면 GPU는 데이터를 기다리며 놀게 됩니다. HBM은 이 병목을 풀어주는 메모리입니다.
HBM 세대별 차이
HBM은 세대를 거치며 대역폭과 용량이 계속 커졌습니다.
세대 | 특징 | 탑재 예시 |
|---|---|---|
HBM3 | 80GB급, 3.35TB/s 수준 | H100 |
HBM3e | 용량·대역폭 향상(141~192GB) | H200, B200 |
HBM4 | 인터페이스 2배(2048-bit), 대역폭 대폭 상승 | 차세대(GB300 등) |
HBM3e는 HBM3의 개선판으로, 핀당 전송 속도를 크게 높여 같은 인터페이스에서 더 높은 대역폭을 냅니다. HBM4는 인터페이스 폭 자체를 2배로 넓혀 한 단계 더 큰 도약을 예고하고 있습니다.
실제 GPU로 보는 HBM
2026년 기준 대표 GPU들의 HBM 스펙을 보면 차이가 분명합니다.
GPU | HBM | 용량 | 대역폭 |
|---|---|---|---|
H100 | HBM3 | 80GB | 3.35TB/s |
H200 | HBM3e | 141GB | 4.8TB/s |
B200 | HBM3e | 192GB | 약 8TB/s |
※ 수치는 2026년 공개 사양 기준이며 폼팩터에 따라 달라질 수 있습니다.
H100에서 H200으로 가면 연산 코어(아키텍처)는 같은데도 메모리만 HBM3e로 바뀌면서 대역폭이 약 43% 올라갑니다. 이것만으로도 메모리 바운드인 LLM 추론 성능이 눈에 띄게 향상됩니다. 같은 아키텍처라도 HBM이 성능을 가르는 대표적인 사례입니다.
HBM이 GPU 공급을 좌우한 이유
한때 AI GPU 부족의 진짜 병목은 GPU 칩 자체가 아니라 HBM이었습니다. 고성능 HBM은 여러 칩을 정밀하게 쌓아 올리는 고난도 공정이라 생산 수율을 단기간에 올리기 어렵고, 만들 수 있는 업체도 소수입니다. 그래서 GPU 다이(die)는 준비돼도 HBM 공급이 못 따라가 GPU 출하가 지연되는 상황이 벌어졌습니다.
이는 AI 인프라에서 메모리가 곧 전략 자원이 됐다는 것을 보여줍니다.
자주 묻는 질문 (FAQ)
Q. HBM과 일반 RAM(DDR)의 차이는 무엇인가요?
DDR은 평면으로 배치되는 반면, HBM은 여러 칩을 수직으로 쌓아 훨씬 넓은 대역폭을 제공합니다. AI처럼 대량의 데이터를 빠르게 옮겨야 하는 작업에 유리합니다.
Q. LLM 성능은 FLOPS와 HBM 중 무엇이 더 중요한가요?
추론(특히 토큰 생성)은 메모리 바운드라, 많은 경우 연산 능력보다 HBM 대역폭이 속도를 더 크게 좌우합니다.
Q. HBM3e와 HBM4는 어떻게 다른가요?
HBM3e는 HBM3의 속도·용량 개선판이고, HBM4는 인터페이스 폭을 2배로 넓혀 대역폭을 한 단계 더 끌어올린 차세대 규격입니다.
Q. HBM 용량이 크면 무조건 좋은가요?
용량은 "어떤 크기의 모델이 올라가는가"를, 대역폭은 "얼마나 빠른가"를 결정합니다. 둘 다 중요하며 워크로드에 따라 우선순위가 다릅니다.
결론: HBM은 AI GPU 성능의 숨은 결정자입니다
GPU를 고를 때 흔히 연산 성능(FLOPS)을 먼저 보지만, 실제 LLM 서비스에서는 HBM 용량과 대역폭이 성능과 비용을 좌우하는 경우가 많습니다. 용량은 어떤 모델이 올라갈지를, 대역폭은 얼마나 빠르게 돌지를 결정합니다.
그리고 이렇게 값비싼 HBM을 탑재한 GPU일수록, 그 메모리를 얼마나 효율적으로 나눠 쓰느냐가 중요해집니다. 큰 HBM을 가진 GPU 한 장을 작은 작업 하나가 통째로 차지하면, 그 비싼 메모리 대부분이 낭비됩니다. TEN의 AIPub은 GPU를 블록 단위로 분할해 여러 워크로드가 HBM을 포함한 GPU 자원을 나눠 쓰도록 하고, GPU 메모리 대역폭 사용률까지 실시간으로 모니터링해 값비싼 메모리가 놀지 않도록 지원합니다.
고가의 HBM 탑재 GPU를 효율적으로 나눠 쓰고 싶다면, AIPub을 확인해 보세요.
어떤 GPU가 우리팀에 적합할지부터 고민이라면, R:AX를 통해 1회 무료 컨설팅을 받아보세요! (최초 고객에 한해 제공)
참고 자료
NVIDIA, H200 / B200 Product Datasheet (2026)
JEDEC, High Bandwidth Memory (HBM) DRAM Standard
Micron / SK hynix, HBM3e Technical Brief