Choisissez votre langue
Formation Site Reliability Engineering
Plus de 2 millions d'étudiants dans le monde

Formation Site Reliability Engineering

4,8

Maîtrisez la discipline d'ingénierie qui maintient en fonctionnement les systèmes les plus critiques du monde. Ce cours vous fournit les frameworks, les outils et les pratiques concrètes utilisés par les équipes SRE à grande échelle — des SLO et budgets d'erreur à la gestion des incidents et à l'ingénierie du chaos. Que vous vous orientiez vers le SRE ou que vous montiez en compétences dans votre poste actuel, voici la base structurée dont vous avez besoin.

Dedika pour les entreprises

Ce que vous allez apprendre:

Vous développerez un ensemble complet de compétences SRE en commençant par les principes fondamentaux, les SLI, les SLO et les budgets d'erreur, puis en abordant l'observabilité, la conception des alertes et la gestion d'astreinte. Vous apprendrez à diriger la réponse aux incidents, à mener des post-mortems sans blâme et à piloter l'amélioration continue. Le cours couvre la réduction de la peine, l'automatisation de l'infrastructure, la livraison progressive et la planification de capacité. Vous explorerez également l'ingénierie de la résilience, les expériences de chaos, la fiabilité de Kubernetes et les techniques d'AIOps. À la fin, vous posséderez la profondeur technique et les compétences organisationnelles nécessaires pour construire et faire évoluer des systèmes fiables.

Comment vous étudiez de façon pratique Formation Site Reliability Engineering

Comment vous pratiquez Formation Site Reliability Engineering

Pour vous, entreprise, qui souhaitez former votre équipe

Avec Dedika pour les entreprises, le cours inclut des exercices et des exemples adaptés à votre activité et aux besoins spécifiques de votre entreprise.

Cliquez ici

Contenu du cours

8 Chapitres • 38 LeçonsDurée entre 4 et 360 heures (vous décidez)

Chapitre 1Voir les détails

Fondamentaux de l'ingénierie de la fiabilité des sites (SRE)

  • Leçon 1 • Structure de l'équipe SRE et rôles

    Examine comment les équipes SRE sont organisées, dotées en personnel et intégrées dans les organisations. Clarifie les limites des rôles avec les équipes de développement et de plateforme.

  • Leçon 2 • Concepts clés et terminologie de la SRE

    Définit les SLI, les SLO, les SLA, les budgets d'erreur et le travail pénible. Un vocabulaire partagé permet une communication précise entre les équipes d'ingénierie et métier.

  • Leçon 3 • Culture de la fiabilité et incitations

    Explore la sécurité psychologique, la culture sans blâme et l'alignement des incitations. Les fondements culturels déterminent le succès ou l'échec des pratiques techniques.

  • Leçon 4 • Origines et philosophie de la SRE

    Retrace l'émergence de la SRE à partir de l'ingénierie logicielle appliquée aux opérations. Fournit un contexte historique qui encadre chaque pratique technique ultérieure.

Chapitre 2Voir les détails

Mesurer la fiabilité avec les SLI et les SLO

  • Leçon 1 • Politique et gestion du budget d'erreur

    Définit comment les budgets d'erreur sont calculés, suivis et appliqués. Les budgets d'erreur traduisent des objectifs de fiabilité abstraits en décisions d'ingénierie exploitables.

  • Leçon 2 • Définir des objectifs de SLO réalistes

    Couvre la négociation, l'établissement de références et l'affinage itératif des valeurs des SLO. Les objectifs doivent équilibrer les attentes des utilisateurs avec la faisabilité technique.

  • Leçon 3 • Choisir des SLI pertinents

    Guide la sélection de métriques qui reflètent fidèlement l'expérience utilisateur. Un mauvais choix de SLI compromet l'ensemble du système de mesure de la fiabilité.

  • Leçon 4 • Tableaux de bord et rapports SLO

    Enseigne la construction de tableaux de bord SLO et de pipelines de reporting automatisés. La visibilité garantit que les équipes agissent sur les données de fiabilité plutôt que de les ignorer.

Chapitre 3Voir les détails

Surveillance, observabilité et alerting

  • Leçon 1 • Gestion des astreintes et runbooks

    Structure les rotations d'astreinte, les chemins d'escalade et la création de runbooks. Des pratiques d'astreinte efficaces réduisent le temps moyen de résolution et l'épuisement professionnel des ingénieurs.

  • Leçon 2 • Piliers de l'observabilité : métriques, logs, traces

    Présente les trois piliers de l'observabilité et leurs rôles complémentaires. Comprendre chaque pilier évite une dépendance excessive à une seule source de données.

  • Leçon 3 • Architecture du système de surveillance

    Examine les architectures de surveillance évolutives, y compris les modèles push vs pull et le stockage à long terme. Les choix d'architecture affectent le coût, la fiabilité et les performances des requêtes.

  • Leçon 4 • Instrumentation et collecte de données

    Couvre les techniques d'instrumentation au niveau du code et de l'infrastructure. Une instrumentation correcte est un prérequis pour une observabilité pertinente.

  • Leçon 5 • Conception d'un alerting efficace

    Enseigne l'alerting basé sur les symptômes, les alertes de vélocité de consommation multi-fenêtres et le routage des alertes. Des alertes bien conçues réduisent la fatigue d'astreinte et améliorent le temps de réponse.

Chapitre 4Voir les détails

Gestion et réponse aux incidents

  • Leçon 1 • Techniques de diagnostic et d'atténuation

    Enseigne le diagnostic systématique à l'aide des données d'observabilité et du débogage piloté par hypothèse. Une atténuation rapide limite l'impact sur l'utilisateur pendant que l'analyse des causes racines se poursuit.

  • Leçon 2 • Coordination et commandement des incidents

    Couvre les rôles de commandant d'incident, responsable des communications et secrétaire de séance. Une attribution claire des rôles évite la confusion et accélère la résolution lors d'événements à fort stress.

  • Leçon 3 • Post-mortems sans blâme

    Guide la rédaction et l'animation de post-mortems sans blâme qui produisent des actions d'amélioration concrètes. Les post-mortems sont le principal mécanisme d'apprentissage organisationnel.

  • Leçon 4 • Classification des incidents et sévérité

    Définit les niveaux de sévérité, les critères d'impact et les procédures de triage. Une classification cohérente garantit une réponse proportionnée et une allocation des ressources adéquate.

  • Leçon 5 • Métriques d'incident et amélioration continue

    Suit le MTTD, le MTTR et la fréquence des incidents pour mesurer l'efficacité de la réponse. L'analyse des tendances conduit à des améliorations ciblées des processus et des outils.

Chapitre 5Voir les détails

Réduction du travail pénible et automatisation

  • Leçon 1 • Principes de conception de l'automatisation

    Couvre les exigences d'idempotence, de sécurité et d'observabilité pour l'automatisation opérationnelle. Une automatisation mal conçue crée de nouveaux modes de défaillance pires que le travail pénible qu'elle remplace.

  • Leçon 2 • Mesurer l'efficacité de l'automatisation

    Suit la réduction du travail pénible, la couverture de l'automatisation et les taux d'échec des systèmes automatisés. La mesure valide l'investissement dans l'automatisation et met en évidence les régressions.

  • Leçon 3 • Automatisation des workflows opérationnels

    Applique l'automatisation aux tâches SRE courantes telles que les déploiements, la mise à l'échelle et la correction. L'automatisation des workflows libère les ingénieurs pour un travail de fiabilité à plus forte valeur ajoutée.

  • Leçon 4 • Fondamentaux de l'infrastructure en tant que code

    Présente le provisionnement déclaratif de l'infrastructure et la gestion de la configuration. L'IaC est le fondement d'une automatisation reproductible et auditable de l'infrastructure.

  • Leçon 5 • Identifier et quantifier le travail pénible

    Définit les caractéristiques du travail pénible et les méthodes de mesure pour suivre son coût. La quantification construit l'argumentaire métier pour l'investissement dans l'automatisation.

Chapitre 6Voir les détails

Ingénierie des mises en production et gestion des changements

  • Leçon 1 • Feature Flags et lancements en mode furtif (Dark Launches)

    Couvre l'architecture des feature flags, les règles de ciblage et l'hygiène opérationnelle. Les flags dissocient le déploiement de la mise en production, permettant une expérimentation plus sûre.

  • Leçon 2 • Principes d'ingénierie des mises en production

    Établit la reproductibilité, les constructions hermétiques et la politique en tant que code pour les mises en production. Une ingénierie des mises en production solide évite la dérive de configuration et les problèmes de chaîne d'approvisionnement.

  • Leçon 3 • Intégration continue et livraison continue

    Couvre la conception du pipeline CI, les barrières de test et l'optimisation de la fréquence de déploiement. Une fréquence de déploiement élevée avec des barrières de qualité réduit la taille des lots et le rayon d'explosion.

  • Leçon 4 • Stratégies de rollback et de rollforward

    Définit les critères et les mécanismes pour des décisions rapides de rollback et de rollforward. Une capacité de rollback fiable est le filet de sécurité pour toutes les stratégies de déploiement.

  • Leçon 5 • Stratégies de livraison progressive

    Enseigne les déploiements canary, les déploiements blue-green et la répartition du trafic. La livraison progressive limite le rayon d'explosion et permet des décisions de déploiement basées sur les données.

Chapitre 7Voir les détails

Planification de capacité et ingénierie des performances

  • Leçon 1 • Techniques de modélisation de la capacité

    Introduit les modèles d'utilisation des ressources, les bases de la théorie des files d'attente et les objectifs de marge de manœuvre. Les modèles traduisent les prévisions de demande en décisions concrètes de provisionnement.

  • Leçon 2 • Tests de charge et benchmarking

    Enseigne la conception, l'exécution et l'interprétation des résultats des tests de charge pour la validation de la capacité. Les tests de charge révèlent les goulots d'étranglement avant que le trafic de production ne les expose.

  • Leçon 3 • Prévision de la demande et modélisation de la charge

    Couvre l'analyse des schémas de trafic, la modélisation de la saisonnalité et la projection de la croissance. Des prévisions précises de la demande évitent à la fois le sous-provisionnement et les dépenses excessives.

  • Leçon 4 • Auto-scaling et infrastructure élastique

    Conçoit des politiques d'auto-scaling horizontal et vertical liées aux signaux pertinents pour les SLO. L'infrastructure élastique absorbe les pics de demande tout en maîtrisant les coûts.

  • Leçon 5 • Stratégies d'optimisation des performances

    Couvre le profilage, la mise en cache, le pooling de connexions et l'optimisation des requêtes. Les améliorations de performances étendent la capacité sans dépenses d'infrastructure supplémentaires.

Chapitre 8Voir les détails

Ingénierie de la résilience et tolérance aux pannes

  • Leçon 1 • Fondamentaux de l'ingénierie du chaos

    Introduit les principes de l'ingénierie du chaos, la conception d'hypothèses et le contrôle du rayon d'explosion. L'injection contrôlée de pannes révèle les faiblesses cachées avant que les incidents réels ne se produisent.

  • Leçon 2 • Architecture de redondance et de basculement

    Examine les modèles de redondance actif-actif, actif-passif et multi-région. L'architecture de redondance détermine les objectifs de temps de récupération et de perte de données.

  • Leçon 3 • Modèles de conception pour la résilience

    Couvre les coupe-circuits (circuit breakers), les cloisons étanches (bulkheads), les tentatives et les délais d'attente en tant que primitives de résilience essentielles. Les modèles empêchent les pannes en cascade et limitent le rayon d'explosion.

  • Leçon 4 • Gestion des dépendances et des risques

    Cartographie les dépendances externes, évalue la probabilité de défaillance et conçoit des contrôles d'atténuation. Le risque lié aux dépendances est une cause majeure d'incidents de fiabilité.

  • Leçon 5 • Planification de la reprise après sinistre (DR)

    Couvre la sélection de la stratégie DR, la création de runbooks et la cadence régulière des tests DR. Les plans DR non testés échouent au moment où ils sont le plus nécessaires.

Certification

Votre certificat valide de réussite

Ce cours est fait pour vous :

  • Ingénieurs DevOps : prêts à adopter une discipline d'ingénierie plus rigoureuse et axée sur la fiabilité.

  • Développeurs backend : assumant des responsabilités opérationnelles et ayant besoin d'une approche structurée.

  • Administrateurs système : passant des opérations traditionnelles aux pratiques SRE modernes.

  • Ingénieurs plateforme : cherchant à formaliser les normes de fiabilité au sein de plusieurs équipes de développement.

  • Responsables d'ingénierie : constituant ou supervisant une fonction SRE pour la première fois.

  • Personnes en reconversion professionnelle : venant de l'informatique ou de l'assurance qualité et ciblant spécifiquement des postes SRE.

Ce que disent nos élèves

Vos cours sont parfaits. J'ai acheté le forfait d'un an et j'ai enfin l'opportunité de suivre divers sujets qui m'intéressent sans avoir besoin de changer de plateforme... je vous remercie pour tout ce que vous faites, je vous ai déjà recommandés à d'autres personnes...
Giulio Carlo
Giulio CarloÉtudiant en Marketing Digital
J'aime la façon dont les leçons vont droit au but et comment je peux changer de chapitres et passer le contenu dont je n'ai pas besoin.
Mariana Ferres
Mariana FerresÉtudiante en Photographie
J'aime le contenu et la façon dont les vidéos sont présentées et transcrites, ce qui accélère le processus !
Luciana Alvarenga
Luciana AlvarengaÉtudiante en Design d'Ongles
La plateforme est rapide, simple à utiliser. La diversité du contenu et les vidéos complémentaires aident beaucoup dans l'apprentissage.
André Felipe
André FelipeÉtudiant en Ingénierie de Prompt

Formations principales

FAQ

Qui est Dedika ?

Le certificat est-il valable en France ?

Les cours sont-ils gratuits ?

Quelle est la charge de travail du cours ?

Comment sont les cours ?

Comment fonctionnent les cours ?

Quelle est la durée des cours ?

Quel est le coût ou le prix des cours ?

Qu'est-ce qu'un cours EAD ou en ligne et comment ça marche ?

Cours PDF