Terminologia

I termini seguenti si applicano ad AI Hypercomputer.

Acceleratore
Un dispositivo hardware specializzato, come una GPU o una TPU, progettato per eseguire attività specifiche, come i carichi di lavoro di machine learning, in modo più efficiente rispetto a un processore per uso generico.

Blocca
Una raccolta di blocchi secondari interconnessi. All'interno di un blocco, qualsiasi GPU è raggiungibile tramite il fabric di rete, che garantisce una comunicazione a latenza bassissima per le attività di addestramento distribuito.

Cluster
Una raccolta di blocchi interconnessi uniti da un fabric ad alta velocità. Il fabric di rete non bloccante da est a ovest ti consente di scalare job di addestramento di grandi dimensioni su migliaia di GPU senza riscontrare colli di bottiglia di prestazioni o larghezza di banda.

GPU in cluster
Una categoria di famiglie di macchine per GPU, tra cui A4X, A4, A3 Ultra, A3 Mega e A3 High (8 GPU). Le GPU in cluster consentono ai team di eseguire il deployment e scalare migliaia di acceleratori interconnessi come un unico sistema strettamente accoppiato utilizzando fabric di rete specializzati e manutenzione sincronizzata. Sono ideali per i carichi di lavoro che richiedono sincronizzazione di calcolo, memoria e rete ad alta velocità estremi. I casi d'uso comuni includono modelli di base di pre-addestramento con trilioni di parametri, serving di modelli di frontiera e simulazioni per la scoperta di farmaci.

Manutenzione emergentelink
A volte chiamata manutenzione di emergenza. Un evento di manutenzione non pianificato causato da un problema hardware, software o di sicurezza critico. Per i tipi di macchine con acceleratore supportati, la manutenzione emergente fornisce una notifica anticipata anziché un'interruzione immediata. Questa notifica ti dà il tempo di svuotare gradualmente i carichi di lavoro e, facoltativamente, di attivare la riparazione prima che il sistema termini le VM.

GPU generalelink
Una categoria di famiglie di macchine GPU, tra cui G2, G4, A2, N1+T4 e A3 Edge. Le GPU generali consentono ai team di eseguire il deployment e scalare gli acceleratori NVIDIA con completa autonomia operativa, bypassando la complessità architetturale dei cluster di supercomputer coordinati. Sono ideali per i carichi di lavoro che danno la priorità ad alta affidabilità, provisioning self-service e scalabilità indipendente. I casi d'uso comuni includono inferenza in tempo reale, RAG, prototipazione e addestramento di modelli di piccole e medie dimensioni.

Fabric di rete
Un fabric di rete fornisce connettività a larghezza di banda elevata e bassa latenza tra tutti i blocchi e i Google Cloud servizi di un cluster. Jupiter è l'architettura di rete dei data center di Google che utilizza networking software-defined e commutatori di circuiti ottici per evolvere la rete e ottimizzarne le prestazioni.

Nodo o host
Una singola macchina server fisica nel data center. Ogni host ha risorse di calcolo associate, come gli acceleratori. Il numero e la configurazione di queste risorse di calcolo dipendono dalla famiglia di macchine. Le istanze di Compute Engine vengono sottoposte a provisioning su un host fisico.

Un dominio NVLink, chiamato anche blocco secondario, è l'unità di capacità principale per le macchine A4X Max e A4X. Un dominio NVLink è costituito da 18 istanze A4X Max o A4X (72 GPU) connesse da un sistema NVLink multi-nodo.

Blocco secondario
Un gruppo di host e hardware di connettività associato che si trovano su un singolo rack fisico. Nel contesto delle macchine A4X Max e A4X, un blocco secondario è chiamato anche dominio NVLink.

Superblocco
Un raggruppamento fisico di macchine interconnesse all'interno dei data center. Inserendo le macchine all'interno di un superblocco, ottieni la velocità effettiva di rete estrema e la latenza inferiore al millisecondo necessarie per eseguire carichi di lavoro di addestramento strettamente accoppiati.

Ulteriori informazioni

I seguenti documenti forniscono ulteriori spiegazioni della terminologia pertinente agli argomenti corrispondenti: