
Formation Site Reliability Engineering
Maîtrise la discipline d'ingénierie qui maintient en fonctionnement les systèmes les plus critiques du monde. Ce cours te donne les cadriciels, les outils et les pratiques concrètes utilisés par les équipes SRE à grande échelle – des SLO et budgets d'erreur au commandement lors d'incidents et à l'ingénierie du chaos. Que tu fasses la transition vers le SRE ou que tu souhaites monter en compétences dans ton rôle actuel, voici la base structurée dont tu as besoin.
Ce que vous allez apprendre:
Tu vas te bâtir une gamme complète de compétences SRE en commençant par les principes de base, les SLI, les SLO et les budgets d'erreur, puis en passant à l'observabilité, la conception d'alertes et la gestion des astreintes. Tu apprendras à diriger la réponse aux incidents, à mener des post-mortems sans reproche et à stimuler l'amélioration continue. Le cours couvre la réduction du travail répétitif, l'automatisation de l'infrastructure, la livraison progressive et la planification de la capacité. Tu exploreras aussi le génie de la résilience, les expériences de chaos, la fiabilité de Kubernetes et les techniques d'AIOps. À la fin, tu auras la profondeur technique et les compétences organisationnelles pour créer et faire évoluer des systèmes fiables.
Comment vous étudiez de façon pratique Formation Site Reliability Engineering
Comment vous pratiquez Formation Site Reliability Engineering
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour entreprises, le cours inclut des exercices et des exemples adaptés à votre propre entreprise et à ses besoins spécifiques.
Contenu du cours
8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondements de l'ingénierie de la fiabilité des sites
Fondements de l'ingénierie de la fiabilité des sites
Leçon 1 • Structure et rôles de l'équipe SRE
Examine comment les équipes SRE sont organisées, dotées en personnel et intégrées dans les organisations. Clarifie les limites des rôles avec les équipes de développement et de plateforme.
Leçon 2 • Concepts clés et terminologie de la SRE
Définit les SLI, les SLO, les SLA, les budgets d'erreur et le « toil ». Un vocabulaire commun permet une communication précise entre les équipes d'ingénierie et d'affaires.
Leçon 3 • Culture de la fiabilité et mesures incitatives
Explore la sécurité psychologique, la culture sans blâme et l'alignement des incitations. Les fondations culturelles déterminent la réussite ou l'échec des pratiques techniques.
Leçon 4 • Origines et philosophie de la SRE
Retrace l'émergence de la SRE à partir du génie logiciel appliqué aux opérations. Fournit un contexte historique qui encadre chaque pratique technique subséquente.
Chapitre 2MasquerCacher les détailsVoir les détailsMesurer la fiabilité avec les SLI et les SLO
Mesurer la fiabilité avec les SLI et les SLO
Leçon 1 • Politique et gestion du budget d'erreur
Définit comment les budgets d'erreur sont calculés, suivis et appliqués. Les budgets d'erreur traduisent des objectifs abstraits de fiabilité en décisions d'ingénierie exploitables.
Leçon 2 • Définir des cibles de SLO réalistes
Couvre la négociation, l'établissement de la ligne de base et le raffinement itératif des valeurs des SLO. Les cibles doivent équilibrer les attentes des utilisateurs avec la faisabilité technique.
Leçon 3 • Choisir des SLI significatifs
Guide la sélection de mesures qui reflètent fidèlement l'expérience utilisateur. Un mauvais choix de SLI compromet l'ensemble du système de mesure de la fiabilité.
Leçon 4 • Tableaux de bord et rapports SLO
Enseigne la construction de tableaux de bord SLO et de pipelines de rapports automatisés. La visibilité garantit que les équipes agissent sur les données de fiabilité plutôt que de les ignorer.
Chapitre 3MasquerCacher les détailsVoir les détailsSurveillance, observabilité et alertes
Surveillance, observabilité et alertes
Leçon 1 • Gestion des quarts de garde et manuels d'opérations
Structure les rotations de garde, les chemins d'escalade et la création de manuels d'opérations. Des pratiques de garde efficaces réduisent le temps moyen de résolution et l'épuisement professionnel des ingénieurs.
Leçon 2 • Piliers de l'observabilité : mesures, journaux, traces
Présente les trois piliers de l'observabilité et leurs rôles complémentaires. Comprendre chaque pilier évite une dépendance excessive à une seule source de données.
Leçon 3 • Architecture du système de surveillance
Examine les architectures de surveillance évolutives, y compris les modèles push et pull et le stockage à long terme. Les choix d'architecture affectent le coût, la fiabilité et le rendement des requêtes.
Leçon 4 • Instrumentation et collecte de données
Couvre les techniques d'instrumentation au niveau du code et de l'infrastructure. Une instrumentation adéquate est le prérequis pour une observabilité significative.
Leçon 5 • Conception d'alertes efficaces
Enseigne l'alerte basée sur les symptômes, les alertes de taux de consommation multi-fenêtres et le routage des alertes. Des alertes bien conçues réduisent la fatigue de garde et améliorent le temps de réponse.
Chapitre 4MasquerCacher les détailsVoir les détailsGestion et réponse aux incidents
Gestion et réponse aux incidents
Leçon 1 • Techniques de diagnostic et d'atténuation
Enseigne le diagnostic systématique à l'aide de données d'observabilité et de débogage axé sur les hypothèses. Une atténuation rapide limite l'impact sur l'utilisateur tandis que l'analyse des causes profondes se poursuit.
Leçon 2 • Commandement et coordination des incidents
Couvre les rôles de commandant d'incident, de responsable des communications et de scribe. Une affectation claire des rôles évite la confusion et accélère la résolution lors d'événements très stressants.
Leçon 3 • Post-mortems sans blâme
Guide la rédaction et l'animation de post-mortems sans blâme qui produisent des améliorations exploitables. Les post-mortems sont le principal mécanisme d'apprentissage organisationnel.
Leçon 4 • Classification et gravité des incidents
Définit les niveaux de gravité, les critères d'impact et les procédures de triage. Une classification cohérente garantit une réponse proportionnée et une allocation des ressources.
Leçon 5 • Mesures des incidents et amélioration continue
Suit le MTTD, le MTTR et la fréquence des incidents pour mesurer l'efficacité de la réponse. L'analyse des tendances conduit à des améliorations ciblées des processus et des outils.
Chapitre 5MasquerCacher les détailsVoir les détailsRéduction du « toil » et automatisation
Réduction du « toil » et automatisation
Leçon 1 • Principes de conception de l'automatisation
Couvre les exigences d'idempotence, de sécurité et d'observabilité pour l'automatisation opérationnelle. Une automatisation mal conçue crée de nouveaux modes de défaillance pires que le « toil » qu'elle remplace.
Leçon 2 • Mesure de l'efficacité de l'automatisation
Suit la réduction du « toil », la couverture de l'automatisation et les taux d'échec des systèmes automatisés. La mesure valide l'investissement dans l'automatisation et révèle les régressions.
Leçon 3 • Automatisation des flux de travail opérationnels
Applique l'automatisation aux tâches courantes de la SRE telles que les déploiements, la mise à l'échelle et la correction. L'automatisation des flux de travail libère les ingénieurs pour un travail de fiabilité à plus haute valeur.
Leçon 4 • Principes fondamentaux de l'infrastructure en tant que code
Présente le provisionnement déclaratif de l'infrastructure et la gestion de la configuration. L'IaC est le fondement d'une automatisation reproductible et vérifiable de l'infrastructure.
Leçon 5 • Identification et quantification du « toil »
Définit les caractéristiques du « toil » et les méthodes de mesure pour suivre son coût. La quantification construit le dossier d'affaires pour l'investissement dans l'automatisation.
Chapitre 6MasquerCacher les détailsVoir les détailsIngénierie des publications et gestion des changements
Ingénierie des publications et gestion des changements
Leçon 1 • Indicateurs de fonctionnalité et lancements en mode furtif
Couvre l'architecture des indicateurs de fonctionnalité, les règles de ciblage et l'hygiène opérationnelle. Les indicateurs dissocient le déploiement de la publication, permettant une expérimentation plus sécuritaire.
Leçon 2 • Principes d'ingénierie des publications
Établit la reproductibilité, les versions hermétiques et la politique en tant que code pour les publications. Une bonne ingénierie des publications empêche la dérive de configuration et les problèmes de chaîne d'approvisionnement.
Leçon 3 • Intégration continue et livraison continue
Couvre la conception du pipeline CI, les portes de test et l'optimisation de la fréquence de déploiement. Une fréquence de déploiement élevée avec des portes de qualité réduit la taille des lots et le rayon d'explosion.
Leçon 4 • Stratégies de retour arrière et d'avancement
Définit les critères et les mécanismes pour les décisions rapides de retour arrière et d'avancement. Une capacité de retour arrière fiable est le filet de sécurité pour toutes les stratégies de déploiement.
Leçon 5 • Stratégies de livraison progressive
Enseigne les publications canari, les déploiements bleu-vert et la répartition du trafic. La livraison progressive limite le rayon d'explosion et permet des décisions de déploiement basées sur les données.
Chapitre 7MasquerCacher les détailsVoir les détailsPlanification de la capacité et ingénierie du rendement
Planification de la capacité et ingénierie du rendement
Leçon 1 • Techniques de modélisation de la capacité
Présente les modèles d'utilisation des ressources, les bases de la théorie des files d'attente et les cibles de marge de manœuvre. Les modèles traduisent les prévisions de la demande en décisions concrètes de provisionnement.
Leçon 2 • Tests de charge et analyse comparative
Enseigne la conception de tests de charge, leur exécution et l'interprétation des résultats pour la validation de la capacité. Les tests de charge révèlent les goulots d'étranglement avant que le trafic de production ne les expose.
Leçon 3 • Prévision de la demande et modélisation de la charge
Couvre l'analyse des schémas de trafic, la modélisation de la saisonnalité et la projection de la croissance. Des prévisions précises de la demande évitent à la fois le sous-provisionnement et les dépenses excessives.
Leçon 4 • Infrastructure auto-adaptative et élastique
Conçoit des politiques de mise à l'échelle horizontale et verticale liées aux signaux pertinents pour les SLO. L'infrastructure élastique absorbe les pics de demande tout en contrôlant les coûts.
Leçon 5 • Stratégies d'optimisation du rendement
Couvre le profilage, la mise en cache, le regroupement de connexions et l'optimisation des requêtes. Les améliorations du rendement étendent la capacité sans dépenses d'infrastructure supplémentaires.
Chapitre 8MasquerCacher les détailsVoir les détailsIngénierie de la résilience et tolérance aux pannes
Ingénierie de la résilience et tolérance aux pannes
Leçon 1 • Principes fondamentaux de l'ingénierie du chaos
Présente les principes de l'ingénierie du chaos, la conception d'hypothèses et le contrôle du rayon d'explosion. L'injection contrôlée de défaillances révèle les faiblesses cachées avant que des incidents réels ne surviennent.
Leçon 2 • Architecture de redondance et de basculement
Examine les modèles de redondance actif-actif, actif-passif et multi-région. L'architecture de redondance détermine les objectifs de temps de récupération et de perte de données.
Leçon 3 • Modèles de conception pour la résilience
Couvre les disjoncteurs, les cloisons étanches, les tentatives et les délais d'attente comme primitives fondamentales de résilience. Les modèles empêchent les défaillances en cascade et limitent le rayon d'explosion.
Leçon 4 • Gestion des dépendances et des risques
Cartographie les dépendances externes, évalue la probabilité de défaillance et conçoit des contrôles d'atténuation. Le risque lié aux dépendances est une cause majeure d'incidents de fiabilité.
Leçon 5 • Planification de la reprise après sinistre
Couvre la sélection de la stratégie de DR, la création de manuels d'opérations et la cadence régulière des tests de DR. Les plans de DR non testés échouent lorsqu'ils sont le plus nécessaires.
Votre certificat valide de réussite
Ce cours est pour vous :
Ingénieurs DevOps : prêts à adopter une discipline d'ingénierie plus rigoureuse et axée sur la fiabilité.
Développeurs backend : qui assument des responsabilités opérationnelles et ont besoin d'une approche structurée.
Administrateurs système : qui passent des opérations traditionnelles aux pratiques SRE modernes.
Ingénieurs de plateforme : qui cherchent à formaliser des normes de fiabilité dans plusieurs équipes de développement.
Gestionnaires en ingénierie : qui mettent en place ou supervisent une fonction SRE pour la première fois.
Personnes en réorientation professionnelle : qui viennent de l'informatique ou de l'assurance qualité et qui visent spécifiquement des postes SRE.
Ce que nos apprenants disent
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir à changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont il est présenté ainsi que la transcription des vidéos, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika?
Le certificat est-il valable au Canada ?
Les cours sont-ils gratuits?
Quelle est la charge de travail des cours?
Comment sont les cours?
Comment fonctionnent les cours?
Quelle est la durée des cours?
Quel est le coût ou le prix des cours?
Qu’est-ce qu’un cours EAD ou en ligne et comment ça fonctionne?
Cours PDF




















