AI Infrastructure Engineering
Dal silicio al cluster: come si servono i modelli linguistici più grandi del mondo, in modo veloce ed economico. Ogni lezione unisce teoria, numeri reali, diagrammi animati, simulatori interattivi e un laboratorio pratico.
Perché questo percorso
I wrapper sono una commodity: chiunque può chiamare un'API. Il valore, e il lavoro che non sparirà, sta nello strato sotto: far girare modelli da decine o centinaia di miliardi di parametri con latenza bassa, throughput alto e costo per token sostenibile. Questo corso segue l'ordine in cui i problemi si presentano davvero:
1 · Capire la macchina
GPU, gerarchia di memoria, interconnessioni. Senza questa base ogni ottimizzazione è un tentativo alla cieca.
2 · Capire il carico
Prefill e decode, intensità aritmetica, KV-cache. L'inferenza LLM è un problema di banda, non di FLOPS.
3 · Servire bene
Serving engine, batching, caching, quantizzazione, kernel fusi, speculative decoding.
4 · Scalare
Parallelismo, reti multi-nodo, orchestrazione, autoscaling, routing, osservabilità e benchmark pubblici.
La mappa del corso
Prerequisiti e hardware
Conoscenze
- Python solido e un po' di familiarità con PyTorch.
- Basi di algebra lineare: prodotto matrice-vettore, matrice-matrice.
- Linux da riga di comando, Docker, nozioni di reti.
- Sapere cos'è un Transformer a livello di blocchi (attention + MLP).
Hardware per i laboratori
- Stage 1–2, 5–6, 8: una GPU NVIDIA qualsiasi (anche una RTX consumer o una L4/A10 in cloud).
- Stage 3–4, 11–12: 1–4 GPU da 80 GB (H100/A100) a noleggio orario.
- Stage 7, 9–10: due o più nodi multi-GPU con rete veloce, anche solo per poche ore.
- Ogni laboratorio indica una variante a basso budget.