Scegli la tua lingua
Corso su Infrastruttura AI e Hypercomputer
Più di 2 milioni di studenti in tutto il mondo

Corso su Infrastruttura AI e Hypercomputer

Padroneggiare l'intero stack dell'infrastruttura AI Hypercomputer, dall'hardware degli acceleratori e la rete ad alta velocità all'addestramento distribuito e alle operazioni sui cluster. Questo corso fornisce a ingegneri e architetti la profondità tecnica per progettare, distribuire e gestire sistemi di IA su larga scala con sicurezza. Sia che stia valutando l'hardware o rafforzando i cluster di produzione, ogni unità si collega direttamente alle decisioni reali sull'infrastruttura.

Dedika per aziende

Cosa imparerai:

  • Progettare sistemi di AI Hypercomputer end-to-end che integrano livelli di calcolo, rete e storage.

  • Valutare le specifiche di GPU, TPU e acceleratori personalizzati per abbinare l'hardware ai requisiti del carico di lavoro.

  • Progettare fabric di rete ad alta larghezza di banda e bassa latenza utilizzando InfiniBand, RDMA e topologie di cluster avanzate.

  • Configurare framework di addestramento distribuito con parallelismo di dati, modello e pipeline per modelli con miliardi di parametri.

  • Implementare architetture di storage tolleranti ai guasti con file system paralleli, object store e ripristino tramite checkpoint.

  • Applicare controlli di sicurezza, runbook operativi e pattern di affidabilità ad ambienti di infrastruttura IA in produzione.

Come studi in modo pratico Corso su Infrastruttura AI e Hypercomputer

Come metti in pratica Corso su Infrastruttura AI e Hypercomputer

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 39 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Fondamenti dell'Infrastruttura AI

  • Lezione 1 • Che Cos'è l'Infrastruttura AI

    Definisce l'infrastruttura AI e la distingue dagli stack IT tradizionali. Ancora il capitolo inquadrando ogni argomento successivo all'interno di una visione di sistema unificata.

  • Lezione 2 • Componenti Fondamentali dei Sistemi AI

    Mappa i livelli hardware, software e di rete che compongono un sistema AI. Fornisce la tassonomia dei componenti utilizzata in tutto il corso.

  • Lezione 3 • Introduzione al Concetto di Hypercomputer AI

    Introduce l'Hypercomputer AI come un sistema strettamente integrato e appositamente progettato per l'AI su larga scala. Stabilisce la visione architetturale verso cui il corso si orienta.

  • Lezione 4 • Caratteristiche dei Carichi di Lavoro AI

    Caratterizza i carichi di lavoro di addestramento, inferenza ed elaborazione dati in base alle loro richieste di risorse. Collega il tipo di carico di lavoro alle decisioni di progettazione dell'infrastruttura.

Capitolo 2Vedi dettagli

Approfondimento sull'Hardware di Calcolo Accelerato

  • Lezione 1 • Benchmarking delle Prestazioni degli Acceleratori

    Introduce benchmark standard e strumenti di profilazione per gli acceleratori AI. Consente agli studenti di interpretare criticamente le specifiche dei fornitori.

  • Lezione 2 • TPU e Acceleratori Specifici per Dominio

    Tratta le unità di elaborazione tensoriale e altri chip appositamente progettati e ottimizzati per operazioni su matrici. Confronta i loro trade-off con le GPU generiche.

  • Lezione 3 • Architettura GPU per l'AI

    Spiega gli elementi della microarchitettura GPU critici per il throughput dell'AI. Fonda le decisioni di selezione hardware sulla comprensione architetturale.

  • Lezione 4 • Progettazione di Nodi Multi-Acceleratore

    Esamina come più acceleratori sono impacchettati all'interno di un singolo nodo server. Collega la progettazione a livello di nodo ai risultati delle prestazioni a livello di cluster.

  • Lezione 5 • Strategia di Selezione e Approvvigionamento Hardware

    Guida l'analisi costo-prestazioni per le decisioni di approvvigionamento degli acceleratori. Collega la conoscenza dell'hardware alla pianificazione reale dell'infrastruttura.

Capitolo 3Vedi dettagli

Reti ad Alta Velocità per Cluster AI

  • Lezione 1 • Requisiti di Rete dell'AI Distribuita

    Quantifica le richieste di larghezza di banda e latenza imposte dagli algoritmi di addestramento distribuito. Stabilisce perché la rete standard del data center è insufficiente per l'AI.

  • Lezione 2 • Progettazione della Topologia di Rete

    Tratta le topologie fat-tree, dragonfly e torus utilizzate nei grandi cluster AI. Insegna agli studenti a selezionare la topologia in base ai modelli di traffico e alla scala.

  • Lezione 3 • Calcolo In-Network

    Introduce le capacità di scarico del calcolo integrate nei moderni switch di rete. Mostra come la riduzione in-network acceleri le operazioni collettive.

  • Lezione 4 • RDMA e Fabric ad Alte Prestazioni

    Spiega l'Accesso Diretto alla Memoria Remota e il suo ruolo nell'evitare l'overhead della CPU. Collega RDMA alle tecnologie di fabric utilizzate negli Hypercomputer AI.

  • Lezione 5 • Monitoraggio e Risoluzione dei Problemi di Rete

    Fornisce strumenti e metodi per diagnosticare il degrado delle prestazioni di rete nei cluster AI. Rafforza la conoscenza della topologia con competenze operative.

Capitolo 4Vedi dettagli

Sistemi di Storage Distribuito per l'AI

  • Lezione 1 • File System Paralleli e Distribuiti

    Tratta le architetture dei file system paralleli ad alte prestazioni progettati per HPC e AI. Collega la progettazione del file system al throughput sostenuto su larga scala.

  • Lezione 2 • Tiering e Caching dello Storage

    Introduce gerarchie di storage multilivello che bilanciano costo e prestazioni. Mostra come i livelli di caching riducano la pressione sullo storage primario durante l'addestramento.

  • Lezione 3 • Requisiti e Modelli di Storage per l'AI

    Caratterizza i modelli di I/O dell'ingestione di dataset, del checkpointing e del model serving. Inquadra le scelte di progettazione dello storage in base al comportamento di accesso specifico dell'AI.

  • Lezione 4 • Object Storage per Dataset AI

    Spiega la semantica dell'object storage e la sua idoneità per dataset AI ampi e immutabili. Affronta i modelli di integrazione tra object store e pipeline di addestramento.

  • Lezione 5 • Architettura di Checkpoint e Ripristino

    Progetta sistemi di checkpointing tolleranti ai guasti che minimizzano l'interruzione dell'addestramento. Lega direttamente le prestazioni dello storage ai risultati di resilienza del cluster.

Capitolo 5Vedi dettagli

Framework di Addestramento Distribuito e Parallelismo

  • Lezione 1 • Debug e Profilazione di Job Distribuiti

    Fornisce metodi sistematici per diagnosticare blocchi, ritardatari ed errori di memoria in esecuzioni distribuite. Costruisce la fiducia operativa per la gestione di grandi job di addestramento.

  • Lezione 2 • Operazioni di Comunicazione Collettiva

    Illustra in dettaglio le operazioni all-reduce, all-gather e broadcast utilizzate durante l'addestramento distribuito. Collega le primitive di comunicazione ai flussi di lavoro di sincronizzazione del gradiente.

  • Lezione 3 • Fondamenti dell'Addestramento Distribuito

    Spiega il parallelismo dei dati, il parallelismo dei modelli e il parallelismo a pipeline partendo dai principi fondamentali. Fornisce le basi concettuali per tutte le decisioni a livello di framework.

  • Lezione 4 • Architettura dei Framework di Addestramento

    Esamina i principali framework di addestramento distribuito e le loro filosofie di progettazione. Consente agli studenti di selezionare e configurare i framework per carichi di lavoro specifici.

  • Lezione 5 • Tecniche per l'Addestramento di Grandi Modelli

    Tratta il parallelismo tensoriale, l'ottimizzazione ZeRO e il checkpointing delle attivazioni per modelli con miliardi di parametri. Affronta direttamente le richieste di scala dei carichi di lavoro dell'Hypercomputer AI.

Capitolo 6Vedi dettagli

Architettura del Sistema Hypercomputer AI

  • Lezione 1 • Modellazione delle Prestazioni e Pianificazione della Capacità

    Introduce modelli analitici per prevedere il throughput e l'utilizzo del sistema. Consente agli studenti di dimensionare le distribuzioni Hypercomputer per i carichi di lavoro target.

  • Lezione 2 • Organizzazione di Pod e Cluster

    Descrive come pod di acceleratori, rack e cluster sono organizzati gerarchicamente. Collega il layout fisico alla topologia di rete e alla progettazione dei domini di guasto.

  • Lezione 3 • Principi dell'Architettura Hypercomputer

    Definisce i pilastri architetturali di un Hypercomputer AI: co-progettazione, integrazione stretta e co-ottimizzazione software-hardware. Inquadra la visione a livello di sistema per il capitolo.

  • Lezione 4 • Integrazione della Fabric di Interconnessione

    Illustra come le fabric ad alta velocità sono integrate tra i piani di calcolo, storage e gestione. Rafforza la conoscenza della rete nel contesto del sistema completo.

  • Lezione 5 • Stack Software di Sistema

    Mappa i livelli software dal firmware all'orchestrazione che consentono il funzionamento dell'Hypercomputer. Fornisce il contesto software necessario per gli argomenti di gestione del cluster.

Capitolo 7Vedi dettagli

Orchestrazione del Cluster e Gestione delle Risorse

  • Lezione 1 • Strategie di Schedulazione dei Job

    Tratta la gang scheduling, la prelazione e le code di priorità per i job di addestramento AI. Collega la politica di schedulazione all'utilizzo del cluster e ai risultati di equità.

  • Lezione 2 • Gestione di Cluster Multi-Tenant

    Affronta l'isolamento, l'applicazione delle quote e la condivisione delle risorse tra più team. Garantisce che gli studenti possano gestire l'infrastruttura condivisa senza conflitti.

  • Lezione 3 • Fondamenti di Orchestrazione per l'AI

    Introduce i concetti di orchestrazione dei container adattati per carichi di lavoro AI ad alta intensità di GPU. Stabilisce il vocabolario di schedulazione utilizzato in tutto il capitolo.

  • Lezione 4 • Osservabilità e Alerting del Cluster

    Costruisce uno stack di monitoraggio per l'utilizzo della GPU, lo stato dei job e le metriche dell'infrastruttura. Fornisce la visibilità operativa necessaria per gestire i cluster AI in produzione.

  • Lezione 5 • Autoscaling e Addestramento Elastico

    Spiega l'autoscaling orizzontale e le tecniche di addestramento elastico che si adattano alla disponibilità delle risorse. Collega il dimensionamento dinamico all'efficienza dei costi negli ambienti cloud.

Capitolo 8Vedi dettagli

Affidabilità, Sicurezza e Operation su Larga Scala

  • Lezione 1 • Gestione della Capacità e dei Cambiamenti

    Stabilisce processi per modifiche all'infrastruttura, aggiornamenti del firmware ed espansione della capacità. Garantisce la stabilità operativa man mano che l'Hypercomputer scala nel tempo.

  • Lezione 2 • Tolleranza ai Guasti e Alta Disponibilità

    Tratta i modelli di ridondanza, il rilevamento dei guasti e il ripristino automatico per l'infrastruttura AI. Affronta direttamente i requisiti di affidabilità dei job di addestramento di lunga durata.

  • Lezione 3 • Sicurezza dei Dati e Controllo degli Accessi

    Affronta la cifratura, le politiche di accesso e il logging di audit per i dataset di addestramento e gli artefatti del modello. Collega i requisiti di governance dei dati ai controlli dell'infrastruttura.

  • Lezione 4 • Architettura di Sicurezza per l'Infrastruttura AI

    Definisce il modello di minaccia e i controlli di sicurezza specifici per gli ambienti di calcolo AI. Garantisce che gli studenti possano proteggere i pesi del modello, i dati e le risorse di calcolo.

  • Lezione 5 • Runbook Operativi e Gestione degli Incidenti

    Guida la creazione di runbook per scenari di guasto comuni e procedure di escalation. Costruisce la disciplina operativa richiesta per ambienti AI di produzione.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Ingegnere di sistema: pronto a specializzarsi in ambienti di calcolo IA su larga scala.

  • Cloud architect: amplia la propria esperienza verso hardware IA impegnato e progettazione di cluster.

  • Professionista DevOps: transita verso ruoli infrastrutturali a sostegno dei team di machine learning.

  • Data center engineer: interessato a comprendere le esigenze di hardware e rete specifiche per l'IA.

  • Platform engineer: costruisce infrastruttura interna per sostenere carichi di lavoro di ricerca IA in crescita.

  • Persona in cambiamento di carriera: proviene da HPC o networking e si orienta verso ruoli nell'infrastruttura IA.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF