Corso completo · 12 stage · 62 lezioni e laboratori

AI Infrastructure Engineering

Dal silicio al cluster: come si servono i modelli linguistici più grandi del mondo, in modo veloce ed economico. Ogni lezione unisce teoria, numeri reali, diagrammi animati, simulatori interattivi e un laboratorio pratico.

12
stage progressivi
50
lezioni teoriche
12
laboratori pratici
20+
simulatori interattivi

Perché questo percorso

I wrapper sono una commodity: chiunque può chiamare un'API. Il valore, e il lavoro che non sparirà, sta nello strato sotto: far girare modelli da decine o centinaia di miliardi di parametri con latenza bassa, throughput alto e costo per token sostenibile. Questo corso segue l'ordine in cui i problemi si presentano davvero:

1 · Capire la macchina

GPU, gerarchia di memoria, interconnessioni. Senza questa base ogni ottimizzazione è un tentativo alla cieca.

2 · Capire il carico

Prefill e decode, intensità aritmetica, KV-cache. L'inferenza LLM è un problema di banda, non di FLOPS.

3 · Servire bene

Serving engine, batching, caching, quantizzazione, kernel fusi, speculative decoding.

4 · Scalare

Parallelismo, reti multi-nodo, orchestrazione, autoscaling, routing, osservabilità e benchmark pubblici.

Come usare il corsoOgni stage ha una pagina introduttiva, alcune lezioni teoriche e un laboratorio. Le lezioni contengono quiz di verifica e simulatori interattivi: usali, perché i numeri restano in testa solo se li muovi con le mani. Segna le lezioni come completate: i progressi restano salvati nel tuo browser.

La mappa del corso

Prerequisiti e hardware

Conoscenze

  • Python solido e un po' di familiarità con PyTorch.
  • Basi di algebra lineare: prodotto matrice-vettore, matrice-matrice.
  • Linux da riga di comando, Docker, nozioni di reti.
  • Sapere cos'è un Transformer a livello di blocchi (attention + MLP).

Hardware per i laboratori

  • Stage 1–2, 5–6, 8: una GPU NVIDIA qualsiasi (anche una RTX consumer o una L4/A10 in cloud).
  • Stage 3–4, 11–12: 1–4 GPU da 80 GB (H100/A100) a noleggio orario.
  • Stage 7, 9–10: due o più nodi multi-GPU con rete veloce, anche solo per poche ore.
  • Ogni laboratorio indica una variante a basso budget.
Glossario rapido TTFT time to first token · ITL/TPOT latenza tra token · HBM memoria della GPU · SM streaming multiprocessor · TP/PP/EP parallelismo tensor/pipeline/expert · KV-cache chiavi e valori dell'attention memorizzati · MFU/MBU utilizzo di FLOPS e di banda.