Choisissez votre langue
Cours d'introduction à l'AI Hypercomputer
Plus de 2 millions d'apprenants dans le monde

Cours d'introduction à l'AI Hypercomputer

Maîtrisez l’ensemble de l’infrastructure des systèmes informatiques d’IA, du matériel accélérateur et des réseaux à haute vitesse à l’apprentissage distribué et aux opérations de grappes. Ce cours offre aux ingénieurs et architectes la profondeur technique nécessaire pour concevoir, déployer et gérer en toute confiance des systèmes d’IA à grande échelle. Que vous évaluiez du matériel ou que vous renforciez des grappes de production, chaque module est directement lié à des décisions réelles en matière d’infrastructure.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez des systèmes informatiques d’IA complets de bout en bout en intégrant les couches de calcul, de réseau et de stockage.

  • Évaluez les spécifications des GPU, TPU et accélérateurs personnalisés pour faire correspondre le matériel aux exigences des charges de travail.

  • Concevez des structures de réseau à large bande passante et faible latence à l’aide d’InfiniBand, de RDMA et de topologies de grappes avancées.

  • Configurez des cadriciels d’apprentissage distribué avec parallélisme des données, du modèle et du pipeline pour des modèles à des milliards de paramètres.

  • Mettez en œuvre des architectures de stockage tolérantes aux pannes avec des systèmes de fichiers parallèles, des magasins d’objets et une récupération par points de contrôle.

  • Appliquez des contrôles de sécurité, des manuels opérationnels et des modèles de fiabilité aux environnements de production d’infrastructure d’IA.

Comment vous étudiez de façon pratique Cours d'introduction à l'AI Hypercomputer

Comment vous pratiquez Cours d'introduction à l'AI Hypercomputer

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 39 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l'infrastructure d'IA

  • Leçon 1 • Qu'est-ce que l'infrastructure d'IA

    Définit l'infrastructure d'IA et la distingue des piles informatiques traditionnelles. Ancre le chapitre en encadrant chaque sujet subséquent dans une vue système unifiée.

  • Leçon 2 • Composants principaux des systèmes d'IA

    Cartographie les couches matérielles, logicielles et de réseau informatique qui composent un système d'IA. Fournit la taxonomie des composants utilisée tout au long du cours.

  • Leçon 3 • Introduction au concept d'hyperordinateur d'IA

    Présente l'hyperordinateur d'IA comme un système étroitement intégré et conçu sur mesure pour l'IA à grande échelle. Établit la vision architecturale vers laquelle le cours tend.

  • Leçon 4 • Caractéristiques des charges de travail d'IA

    Caractérise les charges de travail d'entraînement, d'inférence et de traitement de données selon leurs demandes en ressources. Relie le type de charge de travail aux décisions de conception de l'infrastructure.

Chapitre 2Voir les détails

Plongée dans le matériel de calcul accéléré

  • Leçon 1 • Rendement

    Présente les points de repère standard et les outils de profilage pour les accélérateurs d'IA. Permet aux étudiants d'interpréter les spécifications des fournisseurs de façon critique.

  • Leçon 2 • TPU et accélérateurs spécialisés par domaine

    Couvre les unités de traitement tensoriel et autres puces conçues sur mesure, optimisées pour les opérations matricielles. Met en contraste leurs compromis avec ceux des GPU polyvalents.

  • Leçon 3 • Architecture GPU pour l'IA

    Explique les éléments de la microarchitecture GPU essentiels au débit de l'IA. Ancre les décisions de sélection matérielle dans la compréhension architecturale.

  • Leçon 4 • Conception de nœuds multi-accélérateurs

    Examine comment plusieurs accélérateurs sont regroupés dans un seul nœud serveur. Relie la conception au niveau du nœud aux résultats de rendement au niveau de la grappe.

  • Leçon 5 • Stratégie de sélection et d'approvisionnement matériel

    Guide l'analyse coût-rendement pour les décisions d'approvisionnement en accélérateurs. Fait le pont entre les connaissances matérielles et la planification concrète de l'infrastructure.

Chapitre 3Voir les détails

Réseau informatique à haute vitesse pour les grappes d'IA

  • Leçon 1 • Exigences de réseau informatique de l'IA distribuée

    Quantifie les demandes de bande passante et de latence imposées par les algorithmes d'entraînement distribué. Établit pourquoi le réseau informatique de centre de données standard est insuffisant pour l'IA.

  • Leçon 2 • Conception de la topologie de réseau

    Couvre les topologies en arbre gras, libellule et tore utilisées dans les grandes grappes d'IA. Enseigne aux étudiants à sélectionner une topologie en fonction des modes de trafic et de l'échelle.

  • Leçon 3 • Calcul dans le réseau

    Présente les capacités de déchargement de calcul intégrées dans les commutateurs réseau modernes. Montre comment la réduction dans le réseau accélère les opérations collectives.

  • Leçon 4 • RDMA et tissus à haute performance

    Explique l'accès direct à la mémoire à distance et son rôle pour contourner la surcharge du CPU. Relie RDMA aux technologies de tissu utilisées dans les hyperordinateurs d'IA.

  • Leçon 5 • Surveillance et dépannage du réseau

    Fournit des outils et des méthodes pour diagnostiquer la dégradation du rendement du réseau dans les grappes d'IA. Renforce les connaissances sur la topologie avec des compétences opérationnelles.

Chapitre 4Voir les détails

Systèmes de stockage distribué pour l'IA

  • Leçon 1 • Systèmes de fichiers parallèles et distribués

    Couvre les architectures des systèmes de fichiers parallèles haute performance conçus pour le HPC et l'IA. Relie la conception du système de fichiers au débit soutenu à grande échelle.

  • Leçon 2 • Hiérarchisation et mise en cache du stockage

    Présente les hiérarchies de stockage multi-niveaux qui équilibrent le coût et le rendement. Montre comment les couches de mise en cache réduisent la pression sur le stockage principal pendant l'entraînement.

  • Leçon 3 • Exigences et modes de stockage pour l'IA

    Caractérise les modes d'E/S de l'ingestion d'ensembles de données, de l'établissement de points de contrôle et du service de modèles. Encadre les choix de conception de stockage autour du comportement d'accès spécifique à l'IA.

  • Leçon 4 • Stockage d'objets pour les ensembles de données d'IA

    Explique la sémantique du stockage d'objets et son adéquation avec les grands ensembles de données d'IA immuables. Aborde les modes d'intégration entre les magasins d'objets et les pipelines d'entraînement.

  • Leçon 5 • Architecture de points de contrôle et de récupération

    Conçoit des systèmes de points de contrôle tolérants aux pannes qui minimisent l'interruption de l'entraînement. Relie le rendement du stockage directement aux résultats de résilience de la grappe.

Chapitre 5Voir les détails

Cadriciels

  • Leçon 1 • Débogage et profilage des travaux distribués

    Fournit des méthodes systématiques pour diagnostiquer les blocages, les retards et les erreurs mémoire dans les exécutions distribuées. Développe l'assurance opérationnelle pour la gestion de travaux d'entraînement de grande envergure.

  • Leçon 2 • Opérations de communication collective

    Détaille les opérations all-reduce, all-gather et broadcast utilisées lors de l'entraînement distribué. Relie les primitives de communication aux flux de travail de synchronisation des gradients.

  • Leçon 3 • Principes fondamentaux de l'entraînement distribué

    Explique le parallélisme des données, le parallélisme des modèles et le parallélisme des pipelines à partir des premiers principes. Fournit la base conceptuelle pour toutes les décisions au niveau du cadriciel.

  • Leçon 4 • Architecture des cadriciels d'entraînement

    Passe en revue les principaux cadriciels d'entraînement distribué et leurs philosophies de conception. Permet aux étudiants de sélectionner et de configurer des cadriciels pour des charges de travail spécifiques.

  • Leçon 5 • Techniques d'entraînement des grands modèles

    Couvre le parallélisme tensoriel, l'optimisation ZeRO et les points de contrôle d'activation pour les modèles à des milliards de paramètres. Répond directement aux exigences d'échelle des charges de travail des hyperordinateurs d'IA.

Chapitre 6Voir les détails

Architecture système de l'hyperordinateur d'IA

  • Leçon 1 • Modélisation du rendement et planification de la capacité

    Présente des modèles analytiques pour prédire le débit et l'utilisation du système. Permet aux étudiants de dimensionner les déploiements d'hyperordinateurs pour les charges de travail cibles.

  • Leçon 2 • Organisation des pods et des grappes

    Décrit comment les pods d'accélérateurs, les baies et les grappes sont organisés hiérarchiquement. Relie l'agencement physique à la topologie de réseau et à la conception des domaines de défaillance.

  • Leçon 3 • Principes d'architecture de l'hyperordinateur

    Définit les piliers architecturaux d'un hyperordinateur d'IA : la co-conception, l'intégration serrée et la co-optimisation logiciel-matériel. Encadre la vue au niveau du système pour le chapitre.

  • Leçon 4 • Intégration du tissu d'interconnexion

    Détaille comment les tissus à haute vitesse sont intégrés à travers les plans de calcul, de stockage et de gestion. Renforce les connaissances sur le réseau informatique dans le contexte complet du système.

  • Leçon 5 • Pile logicielle système

    Cartographie les couches logicielles, du micrologiciel à l'orchestration, qui permettent le fonctionnement de l'hyperordinateur. Fournit le contexte logiciel nécessaire pour les sujets de gestion des grappes.

Chapitre 7Voir les détails

Orchestration des grappes et gestion des ressources

  • Leçon 1 • Stratégies d'ordonnancement des travaux

    Couvre l'ordonnancement de groupe, la préemption et les files d'attente prioritaires pour les travaux d'entraînement d'IA. Relie la politique d'ordonnancement à l'utilisation de la grappe et aux résultats d'équité.

  • Leçon 2 • Gestion de grappe multi-locataire

    Aborde l'isolation, l'application des quotas et le partage des ressources entre plusieurs équipes. Assure que les étudiants peuvent gérer une infrastructure partagée sans contention.

  • Leçon 3 • Notions fondamentales d'orchestration pour l'IA

    Présente les concepts d'orchestration de conteneurs adaptés aux charges de travail d'IA intensives en GPU. Établit le vocabulaire d'ordonnancement utilisé tout au long du chapitre.

  • Leçon 4 • Observabilité et alertes des grappes

    Construit une pile de surveillance pour l'utilisation du GPU, l'état des travaux et les mesures de l'infrastructure. Fournit la visibilité opérationnelle nécessaire pour gérer les grappes d'IA de production.

  • Leçon 5 • Mise à l'échelle automatique et entraînement élastique

    Explique la mise à l'échelle automatique horizontale et les techniques d'entraînement élastique qui s'adaptent à la disponibilité des ressources. Relie la mise à l'échelle dynamique à l'efficacité des coûts dans les environnements infonuagiques.

Chapitre 8Voir les détails

Fiabilité, sécurité et opérations à grande échelle

  • Leçon 1 • Gestion de la capacité et des changements

    Établit des processus pour les changements d'infrastructure, les mises à jour du micrologiciel et l'expansion de la capacité. Assure la stabilité opérationnelle à mesure que l'hyperordinateur évolue dans le temps.

  • Leçon 2 • Tolérance aux pannes et haute disponibilité

    Couvre les modes de redondance, la détection des défaillances et la récupération automatique pour l'infrastructure d'IA. Répond directement aux exigences de fiabilité des travaux d'entraînement de longue durée.

  • Leçon 3 • Sécurité des données et contrôle d'accès

    Aborde le chiffrement, les politiques d'accès et la journalisation d'audit pour les ensembles de données d'entraînement et les artefacts de modèles. Relie les exigences de gouvernance des données aux contrôles de l'infrastructure.

  • Leçon 4 • Architecture de sécurité pour l'infrastructure d'IA

    Définit le modèle de menace et les contrôles de sécurité spécifiques aux environnements de calcul d'IA. Assure que les étudiants peuvent protéger les poids des modèles, les données et les ressources de calcul.

  • Leçon 5 • Manuels opérationnels et gestion des incidents

    Guide la création de manuels pour les scénarios de défaillance courants et les procédures d'escalade. Développe la discipline opérationnelle requise pour les environnements d'IA de production.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieur système : prêt à se spécialiser dans les environnements de calcul d'IA à grande échelle.

  • Architecte infonuagique : élargir son expertise en matière de matériel dédié à l'IA et de conception de grappes.

  • Professionnel DevOps : transition vers des rôles d'infrastructure soutenant les équipes d'apprentissage automatique.

  • Ingénieur de centre de données : cherchant à comprendre les exigences matérielles et de réseau spécifiques à l'IA.

  • Ingénieur de plateforme : construire une infrastructure interne pour soutenir les charges de travail croissantes en recherche d'IA.

  • Personne en réorientation de carrière : venant du HPC ou du réseautage et pivotant vers des rôles d'infrastructure d'IA.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF