
Formation Site Reliability Engineering
Maîtrisez la discipline d'ingénierie qui maintient en fonctionnement les systèmes les plus critiques du monde. Ce cours vous fournit les frameworks, les outils et les pratiques concrètes utilisés par les équipes SRE à grande échelle — des SLO et budgets d'erreur à la gestion des incidents et à l'ingénierie du chaos. Que vous vous orientiez vers le SRE ou que vous montiez en compétences dans votre poste actuel, voici la base structurée dont vous avez besoin.
Ce que vous allez apprendre:
Vous développerez un ensemble complet de compétences SRE en commençant par les principes fondamentaux, les SLI, les SLO et les budgets d'erreur, puis en abordant l'observabilité, la conception des alertes et la gestion d'astreinte. Vous apprendrez à diriger la réponse aux incidents, à mener des post-mortems sans blâme et à piloter l'amélioration continue. Le cours couvre la réduction de la peine, l'automatisation de l'infrastructure, la livraison progressive et la planification de capacité. Vous explorerez également l'ingénierie de la résilience, les expériences de chaos, la fiabilité de Kubernetes et les techniques d'AIOps. À la fin, vous posséderez la profondeur technique et les compétences organisationnelles nécessaires pour construire et faire évoluer des systèmes fiables.
Comment vous étudiez de façon pratique Formation Site Reliability Engineering
Comment vous pratiquez Formation Site Reliability Engineering
Pour vous, entreprise, qui souhaitez former votre équipe
Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.
Contenu du cours
8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)
Chapitre 1MasquerCacher les détailsVoir les détailsFondamentaux de l'ingénierie de la fiabilité des sites (SRE)
Fondamentaux de l'ingénierie de la fiabilité des sites (SRE)
Leçon 1 • Structure de l'équipe SRE et rôles
Examine comment les équipes SRE sont organisées, dotées en personnel et intégrées dans les organisations. Clarifie les limites des rôles avec les équipes de développement et de plateforme.
Leçon 2 • Concepts clés et terminologie de la SRE
Définit les SLI, les SLO, les SLA, les budgets d'erreur et le travail pénible. Un vocabulaire partagé permet une communication précise entre les équipes d'ingénierie et métier.
Leçon 3 • Culture de la fiabilité et incitations
Explore la sécurité psychologique, la culture sans blâme et l'alignement des incitations. Les fondements culturels déterminent le succès ou l'échec des pratiques techniques.
Leçon 4 • Origines et philosophie de la SRE
Retrace l'émergence de la SRE à partir de l'ingénierie logicielle appliquée aux opérations. Fournit un contexte historique qui encadre chaque pratique technique ultérieure.
Chapitre 2MasquerCacher les détailsVoir les détailsMesurer la fiabilité avec les SLI et les SLO
Mesurer la fiabilité avec les SLI et les SLO
Leçon 1 • Politique et gestion du budget d'erreur
Définit comment les budgets d'erreur sont calculés, suivis et appliqués. Les budgets d'erreur traduisent des objectifs de fiabilité abstraits en décisions d'ingénierie exploitables.
Leçon 2 • Définir des objectifs de SLO réalistes
Couvre la négociation, l'établissement de références et l'affinage itératif des valeurs des SLO. Les objectifs doivent équilibrer les attentes des utilisateurs avec la faisabilité technique.
Leçon 3 • Choisir des SLI pertinents
Guide la sélection de métriques qui reflètent fidèlement l'expérience utilisateur. Un mauvais choix de SLI compromet l'ensemble du système de mesure de la fiabilité.
Leçon 4 • Tableaux de bord et rapports SLO
Enseigne la construction de tableaux de bord SLO et de pipelines de reporting automatisés. La visibilité garantit que les équipes agissent sur les données de fiabilité plutôt que de les ignorer.
Chapitre 3MasquerCacher les détailsVoir les détailsSurveillance, observabilité et alerting
Surveillance, observabilité et alerting
Leçon 1 • Gestion des astreintes et runbooks
Structure les rotations d'astreinte, les chemins d'escalade et la création de runbooks. Des pratiques d'astreinte efficaces réduisent le temps moyen de résolution et l'épuisement professionnel des ingénieurs.
Leçon 2 • Piliers de l'observabilité : métriques, logs, traces
Présente les trois piliers de l'observabilité et leurs rôles complémentaires. Comprendre chaque pilier évite une dépendance excessive à une seule source de données.
Leçon 3 • Architecture du système de surveillance
Examine les architectures de surveillance évolutives, y compris les modèles push vs pull et le stockage à long terme. Les choix d'architecture affectent le coût, la fiabilité et les performances des requêtes.
Leçon 4 • Instrumentation et collecte de données
Couvre les techniques d'instrumentation au niveau du code et de l'infrastructure. Une instrumentation correcte est un prérequis pour une observabilité pertinente.
Leçon 5 • Conception d'un alerting efficace
Enseigne l'alerting basé sur les symptômes, les alertes de vélocité de consommation multi-fenêtres et le routage des alertes. Des alertes bien conçues réduisent la fatigue d'astreinte et améliorent le temps de réponse.
Chapitre 4MasquerCacher les détailsVoir les détailsGestion et réponse aux incidents
Gestion et réponse aux incidents
Leçon 1 • Techniques de diagnostic et d'atténuation
Enseigne le diagnostic systématique à l'aide des données d'observabilité et du débogage piloté par hypothèse. Une atténuation rapide limite l'impact sur l'utilisateur pendant que l'analyse des causes racines se poursuit.
Leçon 2 • Coordination et commandement des incidents
Couvre les rôles de commandant d'incident, responsable des communications et secrétaire de séance. Une attribution claire des rôles évite la confusion et accélère la résolution lors d'événements à fort stress.
Leçon 3 • Post-mortems sans blâme
Guide la rédaction et l'animation de post-mortems sans blâme qui produisent des actions d'amélioration concrètes. Les post-mortems sont le principal mécanisme d'apprentissage organisationnel.
Leçon 4 • Classification des incidents et sévérité
Définit les niveaux de sévérité, les critères d'impact et les procédures de triage. Une classification cohérente garantit une réponse proportionnée et une allocation des ressources adéquate.
Leçon 5 • Métriques d'incident et amélioration continue
Suit le MTTD, le MTTR et la fréquence des incidents pour mesurer l'efficacité de la réponse. L'analyse des tendances conduit à des améliorations ciblées des processus et des outils.
Chapitre 5MasquerCacher les détailsVoir les détailsRéduction du travail pénible et automatisation
Réduction du travail pénible et automatisation
Leçon 1 • Principes de conception de l'automatisation
Couvre les exigences d'idempotence, de sécurité et d'observabilité pour l'automatisation opérationnelle. Une automatisation mal conçue crée de nouveaux modes de défaillance pires que le travail pénible qu'elle remplace.
Leçon 2 • Mesurer l'efficacité de l'automatisation
Suit la réduction du travail pénible, la couverture de l'automatisation et les taux d'échec des systèmes automatisés. La mesure valide l'investissement dans l'automatisation et met en évidence les régressions.
Leçon 3 • Automatisation des workflows opérationnels
Applique l'automatisation aux tâches SRE courantes telles que les déploiements, la mise à l'échelle et la correction. L'automatisation des workflows libère les ingénieurs pour un travail de fiabilité à plus forte valeur ajoutée.
Leçon 4 • Fondamentaux de l'infrastructure en tant que code
Présente le provisionnement déclaratif de l'infrastructure et la gestion de la configuration. L'IaC est le fondement d'une automatisation reproductible et auditable de l'infrastructure.
Leçon 5 • Identifier et quantifier le travail pénible
Définit les caractéristiques du travail pénible et les méthodes de mesure pour suivre son coût. La quantification construit l'argumentaire métier pour l'investissement dans l'automatisation.
Chapitre 6MasquerCacher les détailsVoir les détailsIngénierie des mises en production et gestion des changements
Ingénierie des mises en production et gestion des changements
Leçon 1 • Feature Flags et lancements en mode furtif (Dark Launches)
Couvre l'architecture des feature flags, les règles de ciblage et l'hygiène opérationnelle. Les flags dissocient le déploiement de la mise en production, permettant une expérimentation plus sûre.
Leçon 2 • Principes d'ingénierie des mises en production
Établit la reproductibilité, les constructions hermétiques et la politique en tant que code pour les mises en production. Une ingénierie des mises en production solide évite la dérive de configuration et les problèmes de chaîne d'approvisionnement.
Leçon 3 • Intégration continue et livraison continue
Couvre la conception du pipeline CI, les barrières de test et l'optimisation de la fréquence de déploiement. Une fréquence de déploiement élevée avec des barrières de qualité réduit la taille des lots et le rayon d'explosion.
Leçon 4 • Stratégies de rollback et de rollforward
Définit les critères et les mécanismes pour des décisions rapides de rollback et de rollforward. Une capacité de rollback fiable est le filet de sécurité pour toutes les stratégies de déploiement.
Leçon 5 • Stratégies de livraison progressive
Enseigne les déploiements canary, les déploiements blue-green et la répartition du trafic. La livraison progressive limite le rayon d'explosion et permet des décisions de déploiement basées sur les données.
Chapitre 7MasquerCacher les détailsVoir les détailsPlanification de capacité et ingénierie des performances
Planification de capacité et ingénierie des performances
Leçon 1 • Techniques de modélisation de la capacité
Introduit les modèles d'utilisation des ressources, les bases de la théorie des files d'attente et les objectifs de marge de manœuvre. Les modèles traduisent les prévisions de demande en décisions concrètes de provisionnement.
Leçon 2 • Tests de charge et benchmarking
Enseigne la conception, l'exécution et l'interprétation des résultats des tests de charge pour la validation de la capacité. Les tests de charge révèlent les goulots d'étranglement avant que le trafic de production ne les expose.
Leçon 3 • Prévision de la demande et modélisation de la charge
Couvre l'analyse des schémas de trafic, la modélisation de la saisonnalité et la projection de la croissance. Des prévisions précises de la demande évitent à la fois le sous-provisionnement et les dépenses excessives.
Leçon 4 • Auto-scaling et infrastructure élastique
Conçoit des politiques d'auto-scaling horizontal et vertical liées aux signaux pertinents pour les SLO. L'infrastructure élastique absorbe les pics de demande tout en maîtrisant les coûts.
Leçon 5 • Stratégies d'optimisation des performances
Couvre le profilage, la mise en cache, le pooling de connexions et l'optimisation des requêtes. Les améliorations de performances étendent la capacité sans dépenses d'infrastructure supplémentaires.
Chapitre 8MasquerCacher les détailsVoir les détailsIngénierie de la résilience et tolérance aux pannes
Ingénierie de la résilience et tolérance aux pannes
Leçon 1 • Fondamentaux de l'ingénierie du chaos
Introduit les principes de l'ingénierie du chaos, la conception d'hypothèses et le contrôle du rayon d'explosion. L'injection contrôlée de pannes révèle les faiblesses cachées avant que les incidents réels ne se produisent.
Leçon 2 • Architecture de redondance et de basculement
Examine les modèles de redondance actif-actif, actif-passif et multi-région. L'architecture de redondance détermine les objectifs de temps de récupération et de perte de données.
Leçon 3 • Modèles de conception pour la résilience
Couvre les coupe-circuits (circuit breakers), les cloisons étanches (bulkheads), les tentatives et les délais d'attente en tant que primitives de résilience essentielles. Les modèles empêchent les pannes en cascade et limitent le rayon d'explosion.
Leçon 4 • Gestion des dépendances et des risques
Cartographie les dépendances externes, évalue la probabilité de défaillance et conçoit des contrôles d'atténuation. Le risque lié aux dépendances est une cause majeure d'incidents de fiabilité.
Leçon 5 • Planification de la reprise après sinistre (DR)
Couvre la sélection de la stratégie DR, la création de runbooks et la cadence régulière des tests DR. Les plans DR non testés échouent au moment où ils sont le plus nécessaires.
Votre certificat valide de réussite
Ce cours est fait pour vous :
Ingénieurs DevOps : prêts à adopter une discipline d'ingénierie plus rigoureuse et axée sur la fiabilité.
Développeurs backend : assumant des responsabilités opérationnelles et ayant besoin d'une approche structurée.
Administrateurs système : passant des opérations traditionnelles aux pratiques SRE modernes.
Ingénieurs plateforme : cherchant à formaliser les normes de fiabilité au sein de plusieurs équipes de développement.
Responsables d'ingénierie : constituant ou supervisant une fonction SRE pour la première fois.
Personnes en reconversion professionnelle : venant de l'informatique ou de l'assurance qualité et ciblant spécifiquement des postes SRE.
Ce que disent nos élèves
Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...

J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.

J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !

La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.

Formations principales
FAQ
Qui est Dedika ?
Le certificat est-il valable en France ?
Les cours sont-ils gratuits ?
Quelle est la charge de travail du cours ?
Comment sont les cours ?
Comment fonctionnent les cours ?
Quelle est la durée des cours ?
Quel est le coût ou le prix des cours ?
Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?
Cours PDF




















