Langsung ke konten utama

NVLink: Teknologi Interkoneksi GPU NVIDIA untuk Infrastruktur AI

NVLink: Teknologi Interkoneksi GPU NVIDIA untuk Infrastruktur AI

"NVLink is a high-speed connection for GPUs and CPUs formed by a robust software protocol, typically riding on multiple pairs of wires printed on a computer board. It lets processors send and receive data from shared pools of memory at lightning speed." — NVIDIA

Featured Snippet Answer: NVLink adalah teknologi interkoneksi berkecepatan tinggi milik NVIDIA yang menghubungkan GPU dan CPU dalam sistem akselerasi. Generasi kelima (Blackwell) menawarkan 1,8 TB/s per GPU, sementara generasi keenam (Rubin) mencapai 3,6 TB/s — 14 kali lebih cepat dari PCIe Gen6. NVLink memungkinkan akses memori bersama antar GPU dan komunikasi langsung tanpa CPU, sangat penting untuk pelatihan dan inferensi AI skala besar.

Ringkasan Singkat: NVLink adalah teknologi interkoneksi GPU-ke-GPU berkecepatan tinggi dari NVIDIA untuk komunikasi dalam server dan rack. Generasi ke-6 menawarkan 3,6 TB/s per GPU, 14x lebih cepat dari PCIe Gen6, dan memungkinkan hingga 72 GPU terhubung dalam satu domain. NVLink adalah fondasi infrastruktur AI skala besar.

Di balik setiap model AI raksasa seperti GPT-4, Gemini, atau Claude, ada ribuan GPU yang bekerja bersama sebagai satu sistem terintegrasi. Untuk memungkinkan komunikasi antar GPU dengan kecepatan yang tidak terbayangkan, NVIDIA mengembangkan NVLink — teknologi interkoneksi yang menjadi fondasi infrastruktur AI modern.

Daftar Isi

NVLink adalah interkoneksi berkecepatan tinggi milik NVIDIA yang menghubungkan GPU dan CPU dalam sistem akselerasi. NVLink memungkinkan prosesor mengirim dan menerima data dari memori bersama dengan kecepatan sangat tinggi — jauh lebih cepat daripada PCIe yang digunakan di server konvensional.

NVLink pertama kali diperkenalkan pada 2016 dengan GPU P100 (Pascal) dan terus berkembang seiring setiap arsitektur GPU baru. Saat ini, NVLink telah menjadi standar de facto untuk komunikasi GPU di infrastruktur AI skala besar.

Evolusi Bandwidth NVLink dari Generasi ke Generasi

Bandwidth NVLink meningkat secara dramatis dari generasi ke generasi:

Generasi Arsitektur Bandwidth per GPU Jumlah Link
1 (2016) Pascal P100 160 GB/s 4
2 (2018) Volta V100 300 GB/s 6
3 (2020) Ampere A100 600 GB/s 12
4 (2022) Hopper H100 900 GB/s 18
5 (2024) Blackwell B200 1.800 GB/s 18
6 (2026) Rubin 3.600 GB/s 36

Generasi kelima (Blackwell) menggandakan bandwidth per link dari 50 GB/s menjadi 100 GB/s, mencapai 1,8 TB/s total per GPU — lebih dari 14 kali bandwidth PCIe Gen5. Generasi keenam (Rubin) melipatgandakan lagi menjadi 3,6 TB/s dengan 36 link per GPU, dan 260 TB/s aggregate bandwidth untuk konfigurasi 72 GPU.

Perbedaan antara NVLink dan PCIe sangat signifikan untuk workload AI:

Aspek NVLink 5 (Blackwell) NVLink 6 (Rubin) PCIe Gen5 PCIe Gen6
Bandwidth per GPU 1,8 TB/s 3,6 TB/s 128 GB/s 256 GB/s
Latency Sub-mikrodetik Sub-mikrodetik Tinggi Tinggi
Komunikasi Direct GPU-to-GPU Direct GPU-to-GPU Melalui CPU Melalui CPU
Memory Sharing Unified memory space Unified memory space CPU intervensi CPU intervensi

NVLink 5 adalah 14x lebih cepat dari PCIe Gen5. NVLink 6 adalah 14x lebih cepat dari PCIe Gen6. Ini adalah perbedaan yang menentukan kelayakan pelatihan model AI besar — tanpa NVLink, GPU akan menghabiskan sebagian besar waktu menunggu data, bukan memprosesnya.

NVSwitch: Menghubungkan Puluhan GPU

NVSwitch adalah chip switch yang memperluas konektivitas NVLink di luar GPU individual, memungkinkan semua GPU dalam satu server atau rack terhubung sepenuhnya (all-to-all).

Evolusi NVSwitch:

  • Generasi 1 (2018): 18 port NVLink, 900 GB/s switching capacity, untuk DGX-2 (16 GPU V100)
  • Generasi 2 (2020): Mendukung NVLink 3.0, untuk DGX A100 (8 GPU)
  • Generasi 3 (Hopper): 25,6 Tb/s total bandwidth, fungsi SHARP untuk in-network computing
  • Generasi 4 (Blackwell): 72 port NVLink 5.0, 14,4 TB/s non-blocking switching, switching tingkat rack

NVSwitch generasi keempat memungkinkan domain NVLink 72 GPU, di mana semua 72 GPU terhubung penuh satu sama lain. Ini berarti setiap GPU dapat berkomunikasi dengan GPU lainnya pada kecepatan penuh — tanpa bottleneck.

GB200 NVL72 dan Vera Rubin NVL72

Arsitektur NVL72 adalah implementasi paling canggih dari NVLink dan NVSwitch:

GB200 NVL72 (Blackwell):

  • 36 CPU Grace + 72 GPU Blackwell
  • 9 tray NVLink switch dengan konektivitas full-mesh
  • 130 TB/s aggregate bandwidth
  • Pendinginan cairan wajib (120-230 kW/rack)

Vera Rubin NVL72 (Rubin, 2026):

  • 36 CPU Vera + 72 GPU Rubin
  • NVLink 6 dengan 3,6 TB/s per GPU
  • 260 TB/s aggregate bandwidth
  • 3,6 exaFLOPS AI compute power

Dalam arsitektur NVL72, tidak ada konektivitas langsung GPU-ke-GPU dalam satu tray komputasi. Semua komunikasi melewati fabric NVSwitch eksternal, memastikan semua 72 GPU setara dari perspektif konektivitas.

Scale-Up vs Scale-Out: Peran NVLink

Infrastruktur AI modern memiliki dua lapisan jaringan:

Scale-Up Networking (NVLink):

  • Menghubungkan GPU dalam satu server atau rack
  • Bandwidth sangat tinggi (3,6 TB/s per GPU)
  • Latensi sangat rendah (sub-mikrodetik)
  • Untuk tensor parallelism dan expert parallelism

Scale-Out Networking (InfiniBand / Ethernet):

  • Menghubungkan antar rack dalam cluster
  • Bandwidth moderat (400-800 Gb/s)
  • Latensi lebih tinggi
  • Untuk data parallelism dan pipeline parallelism

Scale-Up (NVLink) memberikan sekitar 18x bandwidth lebih tinggi daripada Scale-Out (InfiniBand/Ethernet). Untuk workload yang membutuhkan komunikasi intensif antar GPU — seperti tensor parallelism pada model MoE — NVLink sangat penting.

NVIDIA NVLink Fusion memungkinkan hyperscaler membangun infrastruktur AI hybrid dengan NVLink scale-up technology dan chip custom (ASIC atau XPU).

Dengan NVLink Fusion, perusahaan dapat mengintegrasikan chip custom mereka dengan ekosistem NVLink yang sudah matang — memungkinkan mereka menggunakan NVLink untuk komunikasi antar chip custom dan GPU NVIDIA.

NVLink Fusion mencakup NVLink SERDES, NVLink chiplets, dan NVLink interconnect yang dapat diintegrasikan dengan chip non-NVIDIA. Ini adalah strategi NVIDIA untuk mempertahankan dominasi interkoneksi bahkan ketika pelanggan mengembangkan chip AI custom sendiri.

Kutipan Para Ahli

"NVLink is a high-speed connection for GPUs and CPUs formed by a robust software protocol, typically riding on multiple pairs of wires printed on a computer board. It lets processors send and receive data from shared pools of memory at lightning speed." — NVIDIA
"NVLink fundamentally changes the way data is transmitted in AI systems, eliminating one of the biggest hurdles to compute expansion." — Seunghoon Hong, Team Leader AI Infrastructure, SK hynix

FAQ (Pertanyaan yang Sering Diajukan)

1. Apa itu NVLink?

NVLink adalah teknologi interkoneksi berkecepatan tinggi milik NVIDIA yang menghubungkan GPU dan CPU dalam sistem akselerasi. Ini memungkinkan komunikasi GPU-ke-GPU langsung dengan bandwidth sangat tinggi dan latensi rendah.

2. Berapa bandwidth NVLink terbaru?

NVLink generasi keenam (Rubin) menawarkan 3,6 TB/s per GPU, 14 kali lebih cepat dari PCIe Gen6. Aggregate bandwidth untuk konfigurasi 72 GPU mencapai 260 TB/s.

3. Apa perbedaan NVLink dan PCIe?

NVLink adalah 14x lebih cepat dari PCIe, memiliki latensi lebih rendah, mendukung direct GPU-to-GPU communication tanpa CPU, dan memungkinkan unified memory space antar GPU. PCIe adalah standar umum yang digunakan untuk berbagai peripheral.

4. Apa itu NVSwitch?

NVSwitch adalah chip switch NVIDIA yang memperluas konektivitas NVLink, memungkinkan semua GPU dalam satu rack terhubung sepenuhnya (all-to-all). NVSwitch generasi keempat mendukung 72 GPU dalam satu domain dengan 14,4 TB/s switching capacity.

5. Apa itu NVL72?

NVL72 adalah arsitektur rack-scale yang menghubungkan 72 GPU dalam satu domain NVLink. GB200 NVL72 (Blackwell) memiliki 130 TB/s bandwidth, sementara Vera Rubin NVL72 (Rubin) mencapai 260 TB/s.

6. Mengapa NVLink penting untuk AI?

Pelatihan model AI besar membutuhkan komunikasi intensif antar GPU. Tanpa NVLink, GPU akan menghabiskan sebagian besar waktu menunggu data, bukan memprosesnya. NVLink adalah fondasi infrastruktur AI skala besar.

7. Apa itu NVLink Fusion?

NVLink Fusion adalah teknologi yang memungkinkan chip custom (ASIC atau XPU) terintegrasi dengan ekosistem NVLink, memungkinkan hyperscaler membangun infrastruktur AI hybrid dengan komunikasi berkecepatan tinggi.

8. Apakah AMD memiliki teknologi setara NVLink?

Ya. AMD memiliki Infinity Fabric yang berfungsi serupa — interkoneksi berkecepatan tinggi antar GPU dalam satu node. Namun, NVLink tetap menjadi standar industri dengan ekosistem yang lebih matang.

Baca

Sumber dan Referensi

Penutup

NVLink adalah fondasi infrastruktur AI modern. Tanpa NVLink, model AI dengan triliunan parameter tidak akan pernah bisa dilatih secara efisien. Dari bandwidth 160 GB/s pada 2016 hingga 3,6 TB/s pada 2026, NVLink telah berkembang lebih cepat dari hampir semua teknologi komputasi lainnya.

Dengan NVSwitch yang memungkinkan 72 GPU terhubung penuh dalam satu domain, dan NVLink Fusion yang membuka integrasi chip custom, NVIDIA memastikan bahwa NVLink tetap menjadi standar industri untuk komunikasi GPU. Dalam era AI agentic dan model mixture-of-experts, NVLink akan semakin penting untuk memungkinkan komunikasi intensif yang dibutuhkan.

Postingan populer dari blog ini

InfiniBand: Jaringan Berkecepatan Tinggi untuk Infrastruktur AI dan HPC

InfiniBand: Jaringan Berkecepatan Tinggi untuk Infrastruktur AI dan HPC "InfiniBand is a critical component in modern data center networking, because it delivers high throughput with consistently low latency." Featured Snippet Answer: InfiniBand adalah teknologi jaringan berkecepatan tinggi yang dirancang khusus untuk komputasi paralel di superkomputer dan klaster GPU AI. Berbeda dengan Ethernet, InfiniBand memiliki latensi sub-mikrodetik (0,6 mikrodetik), RDMA native untuk transfer data langsung antar memori tanpa CPU, dan efisiensi bandwidth hingga 95%. Generasi terbaru Quantum-X800 menawarkan 800 Gb/s dengan SHARP v4 untuk in-network computing. Ringkasan Singkat: InfiniBand adalah teknologi jaringan berkecepatan tinggi yang dirancang untuk komputasi paralel dengan latensi sub-mikrodetik dan RDMA native. Menjadi standar untuk superkomputer dan klaster GPU AI, InfiniBand menawarkan bandwidth hingga 800 Gb/s, efisiensi 95%, dan manajemen terpusat melalui Subnet Man...

Inference AI: Pengertian, Cara Kerja, dan Perbedaannya dengan Training

Inference AI: Pengertian, Cara Kerja, dan Perbedaannya dengan Training "Inference is where AI creates value. Training is where AI learns. Both are essential, but they serve very different purposes."   Featured Snippet Answer: Inference AI adalah tahap di mana model kecerdasan buatan yang sudah dilatih digunakan untuk menghasilkan prediksi atau output dari data baru. Berbeda dengan training yang memakan waktu berhari-hari atau berminggu-minggu, inference terjadi dalam hitungan detik atau milidetik. Inference adalah fase di mana AI memberikan nilai nyata kepada pengguna — menjawab pertanyaan, mengenali gambar, atau membuat rekomendasi. Ringkasan Singkat: Inference AI adalah proses model AI yang sudah dilatih menghasilkan output dari input baru. Berbeda dengan training yang intensif komputasi, inference biasanya lebih cepat dan lebih murah. Inference adalah tahap di mana AI memberikan nilai nyata bagi pengguna — dari chatbot hingga deteksi gambar. Jika training ada...