← Natrag
AI

Navigacija kroz Nvidijin osakaćeni NVLink: Zašto je naša multi-GPU inferencija pala bez Peer-to-Peer

Damir Radulić· 10. srpnja 2026.· 1 min čitanja· 25 pregleda
Navigacija kroz Nvidijin osakaćeni NVLink: Zašto je naša multi-GPU inferencija pala bez Peer-to-Peer
🎧 Poslušaj članak

U svijetu modernog deep learninga, multi-GPU inferencija postala je standard za obradu velikih modela. No, kad smo suočeni s hardverskim ograničenjima poput osakaćenog NVLink-a, performanse mogu dramatično pasti. Naš tim je nedavno doživio upravo to: nakon što je NVLink peer-to-peer (P2P) zakazao, propusnost inferencije je pala za više od 40%. U ovom članku otkrivamo korake koje smo poduzeli da dijagnosticiramo problem i vratimo performanse.

Što je NVLink i zašto je važan?

NVLink je Nvidijin brzi međusobni spoj koji omogućuje GPU-ima izravnu komunikaciju bez prolaska kroz CPU ili sistemsku memoriju. U multi-GPU postavkama, P2P preko NVLink-a ključan je za smanjenje latencije i povećanje propusnosti. Bez njega, svaki GPU mora slati podatke preko PCIe sabirnice, što stvara usko grlo.

Dijagnoza: Kako smo otkrili problem

Naš inferencijski stack koristio je četiri NVIDIA A100 GPU-a povezana NVLink-om. Nakon ažuriranja drajvera, primijetili smo pad propusnosti. Profiliranjem pomoću nvidia-smi i Nsight Systems, otkrili smo da P2P veze nisu aktivne. Daljnjom analizom utvrdili smo da je novi drajver onemogućio P2P zbog sigurnosnih politika.

Rješenje: Eksplicitna GPU-GPU komunikacija

Umjesto oslanjanja na automatski P2P, implementirali smo eksplicitnu komunikaciju koristeći CUDA-aware MPI i NCCL. Ove biblioteke omogućuju ručno upravljanje prijenosom podataka između GPU-a, zaobilazeći PCIe bottleneck. Ključni koraci uključuju:

  • Provjera NVLink topologije pomoću nvidia-smi topo -m.
  • Postavljanje CUDA_VISIBLE_DEVICES za izolaciju GPU-a.
  • Korištenje cudaMemcpyPeer za izravan prijenos podataka.
  • Optimizacija batch size-a kako bi se maksimizirala propusnost.

Rezultati: Povratak performansi

Nakon implementacije, propusnost se vratila na 95% izvorne razine. Latencija je pala za 30%, a ukupna stabilnost sustava se poboljšala. Iako eksplicitna komunikacija zahtijeva više ručnog rada, ona pruža kontrolu potrebnu za izbjegavanje sličnih problema u budućnosti.

NVLinkmulti-GPU inferencijapeer-to-peerusko grlopropusnost

Zanima vas ovakva AI tehnologija?

RiNET gradi sovereign AI rjesenja za javni sektor i poduzeca - od civic intelligence do automatizacije nabave.

Kontaktirajte nas →
0 komentara

Komentari