NVIDIA H200™ NVL이 이끄는
엔터프라이즈 서버 AI 가속 혁신
NVIDIA H200 NVL은 유연한 구성이 필요한 저전력 공랭식 엔터프라이즈 랙 설계에 이상적이며, 크기에 관계없이 모든 AI 및 HPC 워크로드에 가속화를 제공합니다.
NVIDIA NVLink™로 최대 4개가 연결된 GPU와 1.5배 메모리 증가로 거대 언어 모델(LLM) 추론을 최대 1.7배까지 가속화할 수 있으며, HPC 애플리케이션은
H100 NVL보다 최대 1.3배 더 높은 성능을 제공합니다.
생성형 AI와 HPC를 위한 GPU
NVIDIA H200 GPU는 혁신적인 성능과 메모리 설계를 통해 생성형 AI와 HPC 워크로드 처리 능력을 크게 높여줍니다. HBM3E를 최초로 탑재한 H200은 더 크고 빠른 메모리를 기반으로
생성형 AI와 거대 언어 모델(LLM)의 처리 속도를 높이는 한편, HPC 환경에서의 과학 연산 성능까지 강화합니다.
NVIDIA H200 GPU 사양
| 폼팩터 | H200 NVL | H200 SXM |
|---|---|---|
| FP64 | 30 TFLOPS | 34 TFLOPS |
| FP64 Tensor 코어 | 60 TFLOPS | 67 TFLOPS |
| FP32 | 60 TFLOPS | 67 TFLOPS |
| TP32 Tensor 코어2 | 835 TFLOPS | 989 TFLOPS |
| BFLOAT16 Tensor 코어2 | 1,671 TFLOPS | 1,979 TFLOPS |
| FP16 Tensor 코어2 | 1,671 TFLOPS | 1,979 TFLOPS |
| FP8 Tensor 코어2 | 3,341 TFLOPS | 3,958 TFLOPS |
| INT8 Tensor 코어2 | 3,341 TFLOPS | 3,958 TFLOPS |
| GPU 메모리 | 141GB | 141 TFLOPS |
| GPU 메모리 대역폭 | 4.8TB/S | 4.8 TB/s |
| 디코더 | 7 NVDEC | 7 NVDEC |
| 7 JPEG | 7 JPEG | |
| 컨피덴셜 컴퓨팅 | 지원됨 | 지원 |
| 최대 열 설계 전력(TDP) | 최대 600W(구성 가능) | 최대 700W(구성 가능) |
| 멀티 인스턴스 GPU(MIG) | 각각 최대 7개의 MIGs @16.5GB | 최대 7개의 MIG, 각각 18GB |
| 폼 팩터 | PCIe | SXM |
| 듀얼 슬롯(공랭식) | ||
| 인터커넥트 | 2방향 또는 4방향 NVIDIA NVLink 브리지: | NVIDIA NVLink™: 900GB/s |
| GPU당 900GB/s | PCIe Gen5: 128GB/s | |
| PCIe Gen5: 128GB/s | ||
| 서버 옵션 | NVIDIA MXG™ H200 NVL 파트너 및 최대 8개의 GPU를 갖춘 NVIDIA 인증 시스템 | GPU가 4개 또는 8개인 NVIDIA HGX™ H200 파트너 및 NVIDIA-Certified System™ |
| NVIDIA AI Enterprise | 포함 항목 | 추가 가능 |
고성능 LLM 추론으로 얻는 더 깊은 인사이트
끊임없이 진화하는 AI 환경에서 비즈니스는 LLM에 의존하여 다양한 추론 요구 사항을 해결합니다. AI 추론 가속기는 대규모 사용자 기반용으로 규모별로 배포 시 가장 낮은 TCO로
최고 수준의 처리량을 제공해야 합니다. H200은 Llama2와 같은 LLM을 처리할 때 H100 GPU에 비해 추론 속도를 최대 2배까지 향상시킵니다.
Up to 2X the LLM Inference Performance
- 예비 사양. 변경될 수 있습니다.
- Llama2 13B : ISL 128, OSL 2K | Throughput | H100 SXM 1x GPU BS 64 | H200 SXM 1x GPU BS 128
- GPT-3 175B : ISL 80, OSL 200 | x8 H100 SXM GPUs BS 64 | x8 H200 SXM GPUs BS 128
- Llama2 70B : ISL 2K, OSL 128 | Throughput | H100 SXM 1x GPU BS 8 | H200 SXM 1x GPU BS 32
극대화된 HPC 성능
메모리 대역폭은 데이터 전송 속도를 높이고 복잡한 처리 병목 현상을 줄이므로 고성능 컴퓨팅 애플리케이션에 매우 중요합니다. 시뮬레이션, 과학 연구 및 인공지능과 같은 메모리
집약적인 HPC 애플리케이션의 경우 H200의 더 높은 메모리 대역폭을 사용하면 데이터에 효율적으로 액세스하고 조작할 수 있어 CPU에 비해 결과 도출 시간이 110배 더 빠릅니다.
-
110X Higher MILC Performance
MILC
HGX H200 4-GPU vs Dual x86 Relative Performance -
Up to 2X More Application Performance
Geomean of HPC Apps
Relative Performance
- 예비 측정 성능으로 변경될 수 있습니다
- Llama2 70B : ISL 2K, OSL 128 | Throughput | H100 1x GPU BS 8 | H200 1x GPU BS 32