소형 언어모델 서빙을 위한
GPU 분할 전략
벤치마크로 알아본 하드웨어 분할과 컨테이너 수준 GPU 분할가상화
GPU 분할가상화(Fractional GPU Virtualization)는 GPU 한 장을 여러 워크로드가 나눠 쓰게 해, 소형 언어 모델 서빙의 자원 활용률과 처리량을 높입니다. 동일한 H100 노드에서 소형 언어 모델 19종을 서빙한 MIG vs fGPU 벤치마크로, 하드웨어 수준 분할인 NVIDIA MIG와 Backend.AI의 컨테이너 수준 분할 fGPU가 자원 배분과 처리량에서 어떻게 달라지는지 비교하고, 워크로드 특성에 맞는 분할 방식 선택 기준을 알아보세요.
MIG와 fGPU, 무엇이 다른가요?
NVIDIA MIG(Multi-Instance GPU)는 Ampere 세대부터 제공되는 하드웨어 분할 기능입니다. GPU를 1g.10gb, 1g.20gb 같은 프로파일 단위로 나눠 각 인스턴스에 전용 연산 자원과 메모리를 배정하고, 메모리 대역폭 보장, 메모리 보호, SM 성능 격리, 오류 격리를 하드웨어에서 보장합니다. 프로파일 기반이라 분할 구성이 검증된 형태로 고정되는 대신 구성을 바꿀 때는 인스턴스를 다시 만들게 되며, 지원 기종은 데이터센터·워크스테이션 계열입니다. Backend.AI의 fGPU는 같은 분할을 CUDA API 계층의 소프트웨어에서 구현합니다. 0.1, 0.25 같은 소수 값 슬롯으로 비율을 자유롭게 지정할 수 있고, 컨테이너가 종료되면 슬롯이 회수되어 GPU 리셋 없이 다른 비율로 다시 쓸 수 있으며, 시분할(time-slicing)처럼 순서를 나누는 방식이 아니라 메모리와 연산 자원 자체를 나누면서 MIG 지원 여부와 무관하게 GeForce를 포함한 NVIDIA GPU 전반에서 동작합니다.
분할 방식의 선택은 격리 요건과 자원 활용률 중 어디에 무게를 두느냐에 따라 달라집니다. 워크로드 간 격리를 하드웨어 수준에서 보장해야 하는 환경과, 분할 구성을 자주 바꾸며 활용률을 끌어올려야 하는 환경에는 서로 다른 방식이 어울립니다. Backend.AI는 두 분할 방식을 모두 지원하므로 워크로드 특성에 맞게 골라 쓸 수 있습니다. 벤치마크 수행 방법과 19개 모델별 전체 결과, 격리 요건에 따른 판단 기준은 백서 전문에서 확인해보세요.
리소스 다운로드
아래 양식을 작성해 주세요.
관련 서비스
Backend.AI는 자체 개발한 오케스트레이션 및 작업 스케줄러를 기반으로 하는 벤더 중립적 가속 워크로드 호스팅 플랫폼으로, 클라우드 또는 온프레미스(에어갭) 클러스터 위에서 실행됩니다.
서비스 살펴보기 →