
"GPU를 나눠 쓰려면 NVIDIA MIG 쓰면 되지 않나요?" 맞는 말이지만, 절반만 맞습니다. MIG는 강력하지만 분명한 제약이 있고, 그 제약이 실무에서 발목을 잡는 경우가 많습니다. MIG의 한계와, 소프트웨어 기반 공간분할이 그것을 어떻게 푸는지 정리했습니다.
먼저, GPU를 나누는 이유
작은 워크로드 하나에 GPU 한 장을 통째로 배정하면, 그 GPU의 대부분이 놀게 됩니다. 개발·테스트·소규모 추론처럼 GPU의 일부만 쓰는 작업이 많을수록 낭비가 커집니다. 그래서 하나의 GPU를 여러 작업이 나눠 쓰도록 분할하는 것이 활용률을 높이는 핵심입니다.
대표적인 방법이 NVIDIA의 MIG(Multi-Instance GPU)입니다. 그런데 MIG만으로는 해결되지 않는 지점들이 있습니다.
NVIDIA MIG란?
MIG는 하나의 물리 GPU를 하드웨어 수준에서 격리된 여러 인스턴스로 나누는 NVIDIA의 기술입니다. 각 인스턴스는 전용 SM(연산 코어), 전용 메모리, 전용 캐시를 갖습니다.
강점은 하드웨어 격리입니다. 인스턴스 간 간섭이 거의 없어, 한 작업이 다른 작업의 성능에 영향을 주지 않습니다. 멀티테넌트 환경에서 강력한 격리가 필요할 때 유용합니다.
문제는 그 방식이 가진 제약입니다.
MIG의 세 가지 제약
1. 고정된 분할 크기
MIG는 미리 정해진 프로파일(1g, 2g, 3g, 7g 등)로만 나눌 수 있습니다. 예를 들어 H100 80GB는 1g.10gb(1/7), 2g.20gb, 3g.40gb 같은 정해진 크기로만 분할됩니다. "GPU의 15%만", "0.3장만" 같은 임의 분할은 불가능합니다. 워크로드가 필요로 하는 크기와 프로파일이 안 맞으면, 남는 자원이 그대로 낭비됩니다.
2. 최대 7개 인스턴스
하나의 GPU는 아무리 잘게 나눠도 최대 7개 인스턴스까지만 가능합니다. 작은 모델 수십 개를 하나의 GPU에서 돌리고 싶어도, 7개가 한계입니다.
3. 지원 GPU 제약
MIG는 A100, H100, H200, B200 같은 특정 데이터센터 GPU에서만 작동합니다. 그 외 GPU에서는 아예 쓸 수 없습니다.
항목 | MIG |
|---|---|
분할 방식 | 고정 프로파일(미리 정의된 크기) |
최대 분할 수 | 7개 |
임의 비율 분할 | 불가 |
지원 GPU | A100·H100·H200·B200 등 일부 |
분할 변경 | 재구성 필요 |
소프트웨어 공간분할은 무엇이 다른가
MIG의 제약을 푸는 접근이 소프트웨어 기반 공간분할입니다. 하드웨어 프로파일에 묶이지 않고, 소프트웨어 계층에서 GPU 자원을 더 유연하게 나누는 방식입니다.
TEN의 AIPub은 하나의 GPU를 최대 100블록, 1% 단위로 분할할 수 있습니다. "GPU의 15%", "37%"처럼 워크로드가 필요로 하는 만큼 세밀하게 배정할 수 있다는 뜻입니다. MIG의 고정 프로파일로는 불가능한 유연성입니다. 필요에 따라 MIG 방식도 함께 지원합니다.
여기에 더해, AIPub은 유휴 자원을 자동으로 감지해 재배분합니다. 분할해둔 자원이 쓰이지 않으면 회수해 필요한 쪽에 다시 배정하는 것입니다. 고정 분할이 아니라 실제 사용 상황에 맞춰 자원이 흐르도록 합니다.
어떤 환경에 무엇이 맞을까
둘은 배타적이지 않습니다. 하드웨어 수준의 강력한 격리가 반드시 필요한 환경(예: 보안 등급이 다른 테넌트 간 완전 격리)에서는 MIG의 하드웨어 격리가 적합합니다. 반면 다수의 다양한 크기 워크로드를 하나의 GPU에서 세밀하게 나눠 쓰고, 유휴 자원을 유연하게 재활용해야 하는 환경에서는 소프트웨어 공간분할이 활용률을 더 끌어올립니다.
핵심은 "GPU를 나눌 수 있는가"가 아니라 "우리 워크로드에 맞게, 낭비 없이 나눌 수 있는가"입니다.
자주 묻는 질문 (FAQ)
Q. MIG만으로는 부족한가요?
강력한 하드웨어 격리가 필요하면 MIG가 적합합니다. 다만 고정 분할·최대 7개·GPU 제약 때문에, 다양한 크기의 많은 워크로드를 유연하게 나누기에는 한계가 있습니다.
Q. AIPub의 100블록 분할은 MIG와 함께 쓸 수 있나요?
네. AIPub은 소프트웨어 공간분할과 MIG를 모두 지원해, 환경에 맞게 선택하거나 병행할 수 있습니다.
Q. 소프트웨어 분할은 격리가 약하지 않나요?
하드웨어 격리만큼의 물리적 분리는 아니지만, 팀·프로젝트별 자원과 권한을 격리해 워크로드 간 간섭을 관리합니다. 요구되는 격리 수준에 따라 방식을 선택하면 됩니다.
Q. 어떤 GPU에서 쓸 수 있나요?
MIG는 A100·H100 등 일부 GPU에 한정되지만, 소프트웨어 공간분할은 더 넓은 범위의 GPU에서 활용할 수 있습니다.
결론: 나누는 것을 넘어, '맞게' 나눠야 합니다
GPU 분할의 목적은 단순히 쪼개는 것이 아니라, 값비싼 GPU가 놀지 않도록 워크로드에 맞게 낭비 없이 나누는 것입니다. MIG는 하드웨어 격리라는 강점이 있지만 고정 분할·최대 7개·GPU 제약이 따릅니다.
TEN의 AIPub은 GPU를 1% 단위 100블록으로 유연하게 분할하고, 유휴 자원을 자동 감지해 재배분하며, 필요하면 MIG도 함께 지원합니다. 팀·프로젝트별 자원 격리와 50개 이상의 지표 실시간 모니터링까지 하나의 플랫폼에서 제공해, "나눌 수 있는가"를 넘어 "활용률을 실제로 높일 수 있는가"에 답합니다.
GPU를 워크로드에 맞게 낭비 없이 나눠 쓰고 싶다면, AIPub을 확인해 보세요.
👉 AIPub 자세히 보기: https://ten1010.io/
참고 자료
NVIDIA, Multi-Instance GPU (MIG) User Guide
NVIDIA, MIG Profiles for A100 / H100 Documentation
TEN, AIPub Product Guide — GPU Partitioning (2026)