TEN
블로그 채용 문의하기
KO | EN
LinkedIn X YouTube Tistory
블로그 채용 문의하기
AI 인프라

H100 vs H200 vs B200 차이 정리

NVIDIA H100, H200, B200은 무엇이 다를까요? HBM 메모리 용량과 대역폭, 아키텍처(Hopper·Blackwell), FP4 지원, 실제 스펙 수치를 비교하고, LLM 학습·추론 워크로드별로 어떤 GPU를 선택해야 하는지 정리했습니다.
Amanda's avatar
Amanda
Oct 06, 2026
H100 vs H200 vs B200 차이 정리
Contents
먼저 큰 그림: 아키텍처가 다릅니다핵심 스펙 비교H100 → H200: 메모리만 바뀌었는데 왜 빨라질까H200 → B200: 세대가 바뀝니다그래서 무엇을 골라야 할까자주 묻는 질문 (FAQ)결론: 스펙 비교는 시작, 실측이 결정합니다참고 자료

"우리 모델엔 H100이면 될까요, H200이 필요할까요? B200까지 가야 하나요?" GPU를 도입할 때 가장 많이 부딪히는 질문입니다. 세 GPU가 실제로 무엇이 다르고, 어떤 워크로드에 무엇이 맞는지 정리했습니다.

먼저 큰 그림: 아키텍처가 다릅니다

세 GPU는 두 세대의 아키텍처로 나뉩니다.

H100과 H200은 같은 Hopper 아키텍처입니다. 연산 코어(다이) 자체는 동일하고, 결정적 차이는 메모리입니다. H200은 H100의 메모리를 더 크고 빠른 HBM3e로 바꾼 버전이라고 보면 됩니다.

B200은 차세대 Blackwell 아키텍처입니다. 연산 구조 자체가 새로 설계됐고, 특히 추론용 저정밀 연산(FP4)을 네이티브로 지원하는 점이 큰 변화입니다.

핵심 스펙 비교

2026년 공개 사양 기준으로 세 GPU를 비교하면 이렇습니다.

구분

H100

H200

B200

아키텍처

Hopper

Hopper

Blackwell

HBM 종류

HBM3

HBM3e

HBM3e

메모리 용량

80GB

141GB

192GB

메모리 대역폭

3.35TB/s

4.8TB/s

약 8TB/s

FP4 지원

미지원

미지원

지원(네이티브)

※ 수치는 SXM 폼팩터·2026년 공개 사양 기준이며 구성에 따라 달라질 수 있습니다.

H100 → H200: 메모리만 바뀌었는데 왜 빨라질까

H100과 H200은 연산 코어가 같습니다. 그런데도 H200이 메모리 바운드 작업에서 눈에 띄게 빠릅니다. 대역폭이 3.35TB/s에서 4.8TB/s로 약 43% 늘었기 때문입니다.

앞서 다뤘듯 LLM 추론은 메모리 바운드입니다. 토큰을 생성할 때마다 가중치를 메모리에서 읽어와야 하고, 그 읽기 속도가 곧 생성 속도를 결정합니다. 그래서 연산 능력이 같아도 메모리가 빨라지면 추론 처리량이 올라갑니다. 또 용량이 80GB에서 141GB로 늘면서, 더 큰 모델을 한 장에 올리거나 긴 컨텍스트를 위한 KV 캐시를 더 확보할 수 있습니다.

H200 → B200: 세대가 바뀝니다

B200은 단순한 메모리 업그레이드가 아니라 아키텍처 세대 교체입니다. 메모리 대역폭이 약 8TB/s로 또 한 번 크게 뛰고, 용량도 192GB로 늘어납니다.

가장 중요한 변화는 FP4 네이티브 지원입니다. FP4는 4비트 저정밀 연산으로, 추론에서 같은 하드웨어로 훨씬 많은 처리량을 낼 수 있게 해줍니다. NVIDIA는 B200이 H100 대비 LLM 추론에서 최대 수 배 빠르다고 제시하는데, 이 FP4 지원이 그 핵심 근거 중 하나입니다.

그래서 무엇을 골라야 할까

정답은 워크로드에 따라 다릅니다.

상황

추천 방향

예산 제약, 검증된 범용 학습·추론

H100

70B급 모델 단일 GPU 추론, 긴 컨텍스트

H200(큰 메모리)

대규모 추론 서비스, 최신 성능·FP4 활용

B200

핵심 판단 기준은 세 가지입니다. 모델 크기(한 장에 올라가야 하는가), 워크로드 성격(메모리 바운드 추론인가, 연산 바운드 학습인가), 그리고 예산입니다.

다만 실제로는 스펙시트만으로 결정하기 어렵습니다. 같은 B200을 써도 모델 구조, 병렬화 방식, 배치 크기에 따라 실제 처리량은 크게 달라지기 때문입니다. "표기 성능"과 "우리 워크로드에서의 실제 성능"은 다른 문제입니다.

자주 묻는 질문 (FAQ)

Q. H100과 H200 중 뭘 사야 하나요?
큰 모델을 한 장에 올려야 하거나 긴 컨텍스트·높은 추론 처리량이 필요하면 H200이 유리합니다. 그렇지 않다면 H100의 가성비가 좋습니다.

Q. B200은 학습과 추론 중 어디에 더 유리한가요?
둘 다 향상되지만, FP4 네이티브 지원 덕분에 대규모 추론에서 특히 큰 이점을 보입니다.

Q. H200은 H100보다 항상 빠른가요?
메모리 바운드 작업(대부분의 LLM 추론)에서는 확실히 빠릅니다. 연산 바운드 작업에서는 코어가 같아 차이가 작을 수 있습니다.

Q. 스펙만 보고 GPU를 정해도 되나요?
스펙은 출발점일 뿐입니다. 실제 워크로드로 벤치마킹해야 정확한 처리량과 비용을 알 수 있습니다.

결론: 스펙 비교는 시작, 실측이 결정합니다

H100·H200·B200은 각각 메모리와 아키텍처에서 뚜렷한 차이가 있고, 워크로드에 따라 최적 선택이 달라집니다. 하지만 표기 스펙만 비교해 GPU를 정하면, 정작 우리 모델에서 그 성능이 나오지 않을 수 있습니다.

TEN의 인프라 진단 서비스 RA:X는 실제 AI 워크로드를 기반으로 GPU 성능을 벤치마킹합니다. 장비의 표기 사양만 비교하는 것이 아니라, 모델 아키텍처·데이터 크기·병렬화 방식에 따른 실제 처리량과 통신 패턴을 측정해, 우리 워크로드에 어떤 GPU 구성이 최적인지 실측 데이터로 판단하도록 지원합니다. 그리고 도입한 GPU는 AIPub으로 분할·배분해, 값비싼 최신 GPU가 놀지 않도록 운영할 수 있습니다.

RA:X 인프라 진단

우리 워크로드에 맞는 GPU 구성을 실측으로 확인하고 싶다면, RA:X 인프라 진단을 받아보세요.

RA:X 인프라 컨설팅 ‘무료’ 진단 받기 👉

참고 자료

  • NVIDIA, H100 / H200 / B200 Product Datasheet (2026)

  • NVIDIA, Blackwell Architecture Technical Brief

  • NVIDIA, Transformer Engine and FP4 Documentation

Share article
Contents
먼저 큰 그림: 아키텍처가 다릅니다핵심 스펙 비교H100 → H200: 메모리만 바뀌었는데 왜 빨라질까H200 → B200: 세대가 바뀝니다그래서 무엇을 골라야 할까자주 묻는 질문 (FAQ)결론: 스펙 비교는 시작, 실측이 결정합니다참고 자료

TEN

RSS·Powered by Inblog