AI Infrastructure Engineering
Quando scrivi a un chatbot, una scheda grafica in un data center fa miliardi di calcoli per scriverti la risposta. Questo corso spiega, partendo da zero, come far funzionare quei modelli in modo veloce ed economico per migliaia di persone insieme. Ogni lezione unisce spiegazioni semplici, numeri reali, diagrammi animati, simulatori interattivi e un laboratorio pratico.
Perché questo percorso
Costruire un'app che manda domande a un modello tramite un'API (un'interfaccia per far parlare due programmi) è ormai facile: lo sanno fare in tanti. Molto più raro, e prezioso, è saper fare il lavoro che sta sotto: far girare modelli con decine o centinaia di miliardi di parametri in modo che rispondano in fretta (latenza bassa), servano tanti utenti insieme (throughput alto) e costino poco per ogni parola generata. Il corso affronta i problemi nell'ordine in cui si presentano nella realtà:
1 · Capire la macchina
Com'è fatta una GPU, i suoi tipi di memoria e i collegamenti tra le schede. Senza questa base ogni ottimizzazione è un tentativo alla cieca.
2 · Capire il lavoro
Perché generare testo è lento: il limite non è la velocità di calcolo ma la velocità con cui i dati arrivano dalla memoria.
3 · Servire bene
Tecniche per servire tanti utenti con una GPU: raggrupparli, riusare i calcoli, comprimere il modello, scrivere codice GPU più veloce.
4 · Scalare
Usare molte GPU e molti server, accenderli e spegnerli secondo il traffico, misurare tutto e confrontare le soluzioni.
La mappa del corso
Prerequisiti e hardware
Conoscenze
- Sapere a grandi linee cos'è un modello linguistico (LLM) e cos'è una GPU. Ogni altro concetto viene spiegato quando compare.
- Per i laboratori: saper leggere e lanciare programmi in Python e usare il terminale di Linux.
- Utili ma non indispensabili: un po' di PyTorch (la libreria Python per i modelli) e di Docker (lo strumento per impacchettare i programmi).
Hardware per i laboratori
- Stage 1–2, 5–6, 8: una qualsiasi scheda grafica NVIDIA (anche quella di un PC da gioco) oppure una GPU economica noleggiata in cloud a meno di 1 € l'ora.
- Stage 3–4, 11–12: da 1 a 4 GPU con 80 GB di memoria (modelli H100 o A100), noleggiate a ore.
- Stage 7, 9–10: due o più server con più GPU ciascuno, collegati da una rete veloce, anche solo per poche ore.
- Ogni laboratorio indica una variante a basso budget, e molti si possono eseguire anche senza GPU.