Choisissez votre langue
Cours de Deep Learning avancé en vision par ordinateur
Plus de 2 millions d'apprenants dans le monde

Cours de Deep Learning avancé en vision par ordinateur

Maîtrisez l'ensemble de la pile de la vision par ordinateur moderne — des réseaux convolutionnels et des Transformers de vision aux modèles génératifs et au déploiement en production. Ce cours avancé dote les ingénieurs et ingénieures en ML ainsi que les chercheurs et chercheuses des connaissances architecturales, des techniques pratiques et des compétences de déploiement nécessaires pour créer des systèmes de vision à la fine pointe qui performent dans le monde réel.

Dedika pour entreprises

Ce que vous allez apprendre:

  • Concevez et entraînez des CNN, des Transformers de vision et des architectures hybrides pour diverses tâches d'image.

  • Ajustez des architectures préentraînées à l'aide de l'apprentissage par transfert, de l'adaptation de domaine et de stratégies par couche.

  • Créez des pipelines de détection d'objets et de segmentation à l'aide de cadriciels à deux étapes et sans ancrage.

  • Implémentez des GAN, des VAE et des modèles de diffusion pour la synthèse d'images et les flux de travail d'augmentation de données.

  • Appliquez la quantification, l'élagage et la distillation des connaissances pour optimiser les modèles en vue d'une inférence en production.

  • Évaluez l'équité des modèles, interprétez les cartes d'attention et déployez des systèmes de vision avec des pratiques exemplaires de surveillance.

Comment vous étudiez de façon pratique Cours de Deep Learning avancé en vision par ordinateur

Comment vous pratiquez Cours de Deep Learning avancé en vision par ordinateur

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.

Cliquez ici

Contenu du cours

8 Chapitres • 40 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondements de l’apprentissage profond pour la vision

  • Leçon 1 • Fonctions de perte et optimisation

    Examine l’entropie croisée, l’erreur quadratique moyenne et les pertes personnalisées en parallèle avec SGD, Adam et les stratégies de taux d’apprentissage. Permet directement un entraînement efficace des modèles dans les chapitres suivants.

  • Leçon 2 • Protocoles d’entraînement, de validation et de test

    Définit les divisions entraînement/validation/test, le diagnostic de surapprentissage et les bases de la régularisation. Établit des habitudes d’évaluation rigoureuses utilisées tout au long du cours.

  • Leçon 3 • Pipelines de données pour les tâches d’image

    Enseigne le chargement efficace des images, le groupement en lots, la normalisation et les pipelines d’augmentation. Assure que les étudiants peuvent alimenter correctement les données à tout modèle de vision.

  • Leçon 4 • Notions essentielles d’algèbre linéaire et de calcul différentiel

    Couvre les tenseurs, les opérations matricielles, les gradients et la règle de dérivation en chaîne appliqués aux réseaux neuronaux. Fournit le socle mathématique pour tous les concepts ultérieurs d’entraînement de modèles.

  • Leçon 5 • Notions de base sur l’architecture des réseaux neuronaux

    Présente les perceptrons, les fonctions d’activation et les couches entièrement connectées. Relie les mécanismes neuronaux de base aux éléments constitutifs des modèles de vision profonde.

Chapitre 2Voir les détails

Réseaux de neurones convolutifs en profondeur

  • Leçon 1 • Mécanismes de l’opération de convolution

    Explique les noyaux, le pas, le remplissage et les champs récepteurs avec une intuition spatiale. Ancre les étudiants dans l’opération fondamentale qui définit tous les modèles de vision basés sur les CNN.

  • Leçon 2 • Normalisation par lots et régularisation

    Enseigne la normalisation par lots, la normalisation de couche et le placement de l’abandon dans les blocs CNN. Permet un entraînement stable et rapide des réseaux profonds présentés dans les chapitres suivants.

  • Leçon 3 • Architectures CNN classiques et modernes

    Passe en revue AlexNet jusqu’à EfficientNet, en mettant en évidence les choix de conception et les gains de rendement. Fournit le vocabulaire architectural utilisé dans l’apprentissage par transfert et la conception personnalisée.

  • Leçon 4 • Analyse du regroupement et des cartes de caractéristiques

    Couvre le regroupement maximal, le regroupement moyen et le regroupement global pour le sous-échantillonnage spatial. Relie la réduction des cartes de caractéristiques à l’invariance par translation et à l’efficacité du modèle.

  • Leçon 5 • Réglage des hyperparamètres pour les CNN

    Couvre la recherche par grille, la recherche aléatoire et l’optimisation bayésienne pour les hyperparamètres des CNN. Équipe les étudiants pour améliorer systématiquement le rendement des modèles sur les bancs d’essai de vision.

Chapitre 3Voir les détails

Stratégies d’apprentissage par transfert et de réglage fin

  • Leçon 1 • Écosystèmes de modèles pré-entraînés

    Passe en revue les répertoires de modèles, les poids pré-entraînés et les ensembles de données de référence utilisés dans l’apprentissage par transfert. Oriente les étudiants vers les ressources disponibles avant d’appliquer les techniques de réglage fin.

  • Leçon 2 • Extraction de caractéristiques vs réglage fin complet

    Met en contraste l’extraction de caractéristiques par backbone gelé avec les approches de réglage fin de bout en bout. Guide les étudiants dans le choix de la bonne stratégie en fonction de la taille et de la similarité de l’ensemble de données.

  • Leçon 3 • Notions fondamentales de l’adaptation de domaine

    Couvre le décalage de covariable, la mesure de l’écart de domaine et les stratégies d’adaptation pour les modèles de vision. Étend l’apprentissage par transfert aux scénarios où les domaines source et cible diffèrent considérablement.

  • Leçon 4 • Évaluation des résultats de l’apprentissage par transfert

    Définit les métriques pour comparer l’entraînement par transfert vs l’entraînement de novo et diagnostiquer le transfert négatif. Ferme le flux de travail de réglage fin avec une évaluation rigoureuse du rendement.

  • Leçon 5 • Techniques de taux d’apprentissage par couche

    Présente les taux d’apprentissage discriminatifs et le dégel progressif des couches pour un réglage fin stable. Empêche l’oubli catastrophique tout en adaptant les caractéristiques pré-entraînées aux nouveaux domaines.

Chapitre 4Voir les détails

Architectures de détection d’objets et entraînement

  • Leçon 1 • Détecteurs à deux étapes

    Couvre en détail les réseaux de propositions de région R-CNN, Fast R-CNN et Faster R-CNN. Fournit la base historique et technique pour comprendre les pipelines de détection modernes.

  • Leçon 2 • Détecteurs monophases et sans ancre

    Examine SSD, les variantes YOLO, FCOS et CenterNet pour la détection en temps réel. Met en contraste les compromis vitesse-précision avec les approches à deux étapes pour les décisions de déploiement.

  • Leçon 3 • Métriques d’évaluation de la détection

    Enseigne la précision moyenne, les courbes précision-rappel et les protocoles d’évaluation COCO. Permet un étalonnage rigoureux et la comparaison du rendement des modèles de détection.

  • Leçon 4 • Formulation du problème de détection

    Définit la régression de la boîte englobante, les têtes de classification et la perte multitâche pour la détection. Établit le cadre conceptuel avant d’introduire les architectures de détection spécifiques.

  • Leçon 5 • Préparation des données et annotation

    Couvre les formats d’annotation, les outils d’étiquetage et les stratégies d’augmentation spécifiques à la détection. Assure que les étudiants peuvent construire des ensembles de données de détection prêts pour la production à partir de zéro.

Chapitre 5Voir les détails

Segmentation sémantique et par instance

  • Leçon 1 • Préparation d’ensemble de données de segmentation

    Aborde les flux de travail d’annotation de masque, la supervision faible et les stratégies d’étiquetage semi-supervisées. Réduit le coût d’annotation tout en maintenant la qualité du modèle pour les projets de segmentation concrets.

  • Leçon 2 • Notions fondamentales de la segmentation sémantique

    Présente les réseaux entièrement convolutionnels, la conception encodeur-décodeur et les connexions de saut. Établit le paradigme de prédiction dense qui sous-tend toutes les architectures de segmentation.

  • Leçon 3 • Méthodes de segmentation par instance

    Enseigne Mask R-CNN, SOLO et CondInst pour prédire des masques binaires par instance. Fait le pont entre les connaissances en détection d’objets et la différenciation des instances au niveau du pixel.

  • Leçon 4 • Fonctions de perte et métriques de segmentation

    Couvre la perte Dice, la perte focale et l’intersection moyenne sur l’union pour l’entraînement et l’évaluation des modèles de segmentation. Fournit les outils quantitatifs nécessaires pour optimiser et comparer les sorties de prédiction dense.

  • Leçon 5 • Architectures sémantiques avancées

    Couvre U-Net, les convolutions dilatées DeepLab et ASPP pour le contexte multi-échelle. Étend la segmentation fondamentale aux architectures à haute précision utilisées en médecine et en conduite autonome.

Chapitre 6Voir les détails

Transformateurs de vision et mécanismes d’attention

  • Leçon 1 • Réglage fin des transformateurs pour les tâches de vision

    Couvre l’insertion de couches d’adaptation, le réglage par indications visuelles et LoRA pour le réglage fin efficace en paramètres des transformateurs. Réduit le coût de calcul tout en adaptant les grands transformateurs de vision pré-entraînés à des tâches personnalisées.

  • Leçon 2 • Visualisation de l’attention et interprétabilité

    Enseigne l’extraction de cartes d’attention, le déploiement et l’attribution par gradient pour les transformateurs. Permet le débogage de modèles et la communication avec les parties prenantes grâce à des explications visuelles.

  • Leçon 3 • Auto-attention et notions de base des transformateurs

    Explique l’attention requête-clé-valeur, l’attention multi-têtes et les encodages positionnels pour les séquences. Fournit la base théorique avant d’appliquer les transformateurs aux données d’image.

  • Leçon 4 • Architecture du transformateur de vision

    Couvre l’intégration de patchs, les jetons de classe et les exigences d’entraînement de ViT à grande échelle. Relie les concepts de transformateur NLP à la classification d’images par tokenisation basée sur les patchs.

  • Leçon 5 • Transformateurs hybrides et hiérarchiques

    Examine Swin Transformer, PVT et les hybrides CNN-transformateur pour les tâches de prédiction dense. Étend ViT à la détection et à la segmentation en introduisant des cartes de caractéristiques hiérarchiques.

Chapitre 7Voir les détails

Modèles génératifs pour la vision

  • Leçon 1 • Modèles de diffusion pour la synthèse d’images

    Enseigne le processus de bruitage avant, l’appariement de score par débruitage et l’échantillonnage DDPM pour la génération d’images. Positionne les modèles de diffusion comme l’état actuel de l’art en synthèse haute-fidélité.

  • Leçon 2 • Autoencodeurs variationnels pour les images

    Présente l’objectif VAE, l’astuce de reparamétrisation et la structure de l’espace latent pour les images. Établit la modélisation générative probabiliste avant de passer aux méthodes antagonistes et de diffusion.

  • Leçon 3 • Notions fondamentales des réseaux antagonistes génératifs

    Couvre l’objectif minimax, la conception du discriminateur et les problèmes d’instabilité d’entraînement dans les GAN. Fournit la base d’entraînement antagoniste pour la synthèse d’images et le transfert de domaine.

  • Leçon 4 • Modèles génératifs comme augmentation de données

    Couvre la génération de données synthétiques, l’augmentation par GAN et le filtrage qualité pour les tâches en aval. Applique directement les techniques génératives pour améliorer le rendement des modèles discriminatifs.

  • Leçon 5 • GAN conditionnels et haute résolution

    Examine le GAN conditionnel, Pix2Pix, CycleGAN et StyleGAN pour la génération d’images contrôlée. Permet des applications pratiques, notamment la traduction d’image à image et le transfert de style.

Chapitre 8Voir les détails

Optimisation des modèles et déploiement en production

  • Leçon 1 • Distillation de connaissances

    Présente les cadres enseignant-étudiant, les cibles douces et la distillation au niveau des caractéristiques pour les modèles de vision. Transfère la précision des grands modèles vers des réseaux étudiants compacts pour un déploiement efficace.

  • Leçon 2 • Exportation de modèle et optimisation d’exécution

    Couvre l’exportation ONNX, l’optimisation TensorRT et la compilation spécifique au matériel pour l’inférence. Fait le pont entre l’entraînement de modèles de recherche et le service en production sur diverses cibles matérielles.

  • Leçon 3 • Techniques de compression de modèle

    Enseigne l’élagage de poids, l’élagage structuré et la factorisation de bas rang pour réduire la taille du modèle. Permet le déploiement sur des dispositifs à ressources limitées sans perte significative de précision.

  • Leçon 4 • Service, surveillance et cycle de vie du modèle

    Enseigne le service REST et gRPC, les tests A/B et la surveillance de la dérive des données pour les modèles de vision déployés. Complète le pipeline de production avec des pratiques opérationnelles exemplaires pour la fiabilité à long terme.

  • Leçon 5 • Quantification pour l’inférence

    Couvre la quantification post-entraînement, l’entraînement conscient de la quantification et le déploiement INT8 pour les modèles de vision. Réduit l’empreinte mémoire et la latence pour l’inférence en périphérie et dans le nuage.

Certification

Votre certificat valide de réussite

Ce cours est pour vous :

  • Ingénieurs et ingénieures en ML prêts à approfondir leur spécialisation en vision par ordinateur.

  • Scientifiques des données qui passent du travail tabulaire à la modélisation basée sur les images.

  • Ingénieurs et ingénieures logiciels qui intègrent des fonctionnalités visuelles propulsées par l’IA dans des produits réels.

  • Chercheurs et chercheuses en vision par ordinateur à la recherche d’une couverture structurée des architectures modernes.

  • Étudiants et étudiantes des cycles supérieurs faisant le pont entre les travaux académiques et les projets de vision en milieu industriel.

Ce que nos apprenants disent

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Numérique
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika?

Le certificat est-il valable au Canada ?

Les cours sont-ils gratuits?

Quelle est la charge de travail des cours?

Comment sont les cours?

Comment fonctionnent les cours?

Quelle est la durée des cours?

Quel est le coût ou le prix des cours?

Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?

Cours PDF