Scegli la tua lingua
Corso di Site Reliability Engineering
Più di 2 milioni di studenti in tutto il mondo

Corso di Site Reliability Engineering

4,8

Padroneggi la disciplina ingegneristica che mantiene in funzione i sistemi più critici al mondo. Questo corso Le fornisce i framework, gli strumenti e le pratiche concrete utilizzate dai team SRE su larga scala — dagli SLO e gli error budget fino al comando degli incidenti e al chaos engineering. Sia che stia passando a un ruolo SRE o che stia migliorando la sua posizione attuale, questa è la base strutturata di cui ha bisogno.

Dedika per aziende

Cosa imparerai:

Costruirà un set completo di competenze SRE partendo dai principi fondamentali, SLI, SLO ed error budget, per poi passare all'osservabilità, alla progettazione degli avvisi e alla gestione della reperibilità. Imparerà a guidare la risposta agli incidenti, a condurre postmortem senza colpevolizzazione e a promuovere il miglioramento continuo. Il corso tratta la riduzione del lavoro ripetitivo, l'automazione dell'infrastruttura, la distribuzione progressiva e la pianificazione della capacità. Esplorerà anche l'ingegneria della resilienza, gli esperimenti di chaos, l'affidabilità di Kubernetes e le tecniche di AIOps. Alla fine, avrà la profondità tecnica e le capacità organizzative per costruire e scalare sistemi affidabili.

Come studi in modo pratico Corso di Site Reliability Engineering

Come metti in pratica Corso di Site Reliability Engineering

Per te che sei un'azienda e vuoi formare il tuo team

Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.

Clicca qui

Contenuto del corso

8 Capitoli • 38 LezioniDurata tra 4 e 360 ore (decidi tu)

Capitolo 1Vedi dettagli

Fondamenti di Site Reliability Engineering

  • Lezione 1 • Struttura e ruoli del team SRE

    Esamina come i team SRE sono organizzati, dimensionati e inseriti nelle organizzazioni. Chiarisce i confini di ruolo con i team di sviluppo e piattaforma.

  • Lezione 2 • Concetti e terminologia chiave dell'SRE

    Definisce SLI, SLO, SLA, error budget e toil. Un vocabolario condiviso consente una comunicazione precisa tra i team di ingegneria e di business.

  • Lezione 3 • Cultura della reliability e incentivi

    Esplora la sicurezza psicologica, la cultura blameless e l'allineamento degli incentivi. Le basi culturali determinano se le pratiche tecniche avranno successo o falliranno.

  • Lezione 4 • Origini e filosofia dell'SRE

    Traccia l'emergere dell'SRE dall'ingegneria del software applicata alle operations. Fornisce il contesto storico che inquadra ogni successiva pratica tecnica.

Capitolo 2Vedi dettagli

Misurare la reliability con SLI e SLO

  • Lezione 1 • Politica e gestione degli error budget

    Definisce come gli error budget sono calcolati, tracciati e applicati. Gli error budget traducono obiettivi astratti di reliability in decisioni ingegneristiche attuabili.

  • Lezione 2 • Stabilire obiettivi SLO realistici

    Tratta la negoziazione, la baseline e il perfezionamento iterativo dei valori SLO. Gli obiettivi devono bilanciare le aspettative degli utenti con la fattibilità ingegneristica.

  • Lezione 3 • Scegliere SLI significativi

    Guida la selezione di metriche che riflettono accuratamente l'esperienza utente. Una scelta inadeguata degli SLI mina l'intero sistema di misurazione della reliability.

  • Lezione 4 • Dashboard SLO e reporting

    Insegna la costruzione di dashboard SLO e pipeline di reporting automatizzato. La visibilità garantisce che i team agiscano sui dati di reliability anziché ignorarli.

Capitolo 3Vedi dettagli

Monitoraggio, osservabilità e allerta

  • Lezione 1 • Gestione della reperibilità e runbook

    Struttura i turni di reperibilità, i percorsi di escalation e la creazione di runbook. Pratiche di reperibilità efficaci riducono il tempo medio di risoluzione e il burnout degli ingegneri.

  • Lezione 2 • Pilastri dell'osservabilità: metriche, log, tracce

    Introduce i tre pilastri dell'osservabilità e i loro ruoli complementari. Comprendere ciascun pilastro previene l'eccessivo affidamento su una singola fonte di dati.

  • Lezione 3 • Architettura del sistema di monitoraggio

    Esamina architetture di monitoraggio scalabili, inclusi i modelli push vs. pull e l'archiviazione a lungo termine. Le scelte architetturali influenzano costi, reliability e prestazioni delle query.

  • Lezione 4 • Strumentazione e raccolta dati

    Tratta le tecniche di strumentazione a livello di codice e di infrastruttura. Una corretta strumentazione è il prerequisito per un'osservabilità significativa.

  • Lezione 5 • Progettazione efficace degli allarmi

    Insegna l'allerta basata sui sintomi, gli avvisi multi-finestra sul tasso di consumo e l'instradamento degli allarmi. Allarmi ben progettati riducono l'affaticamento da reperibilità e migliorano il tempo di risposta.

Capitolo 4Vedi dettagli

Gestione e risposta agli incidenti

  • Lezione 1 • Tecniche di diagnosi e mitigazione

    Insegna la diagnosi sistematica utilizzando dati di osservabilità e debugging guidato da ipotesi. Una mitigazione rapida limita l'impatto sugli utenti mentre l'analisi della causa radice continua.

  • Lezione 2 • Comando e coordinamento degli incidenti

    Tratta i ruoli di incident commander, responsabile della comunicazione e scriba. Un'assegnazione chiara dei ruoli previene la confusione e accelera la risoluzione durante eventi ad alto stress.

  • Lezione 3 • Postmortem blameless

    Guida la scrittura e la facilitazione di postmortem blameless che producono miglioramenti attuabili. I postmortem sono il meccanismo principale per l'apprendimento organizzativo.

  • Lezione 4 • Classificazione e gravità degli incidenti

    Definisce i livelli di gravità, i criteri di impatto e le procedure di triage. Una classificazione coerente garantisce una risposta e un'allocazione delle risorse proporzionate.

  • Lezione 5 • Metriche degli incidenti e miglioramento continuo

    Traccia MTTD, MTTR e frequenza degli incidenti per misurare l'efficacia della risposta. L'analisi delle tendenze guida miglioramenti mirati a processi e strumenti.

Capitolo 5Vedi dettagli

Riduzione del toil e automazione

  • Lezione 1 • Principi di progettazione dell'automazione

    Tratta i requisiti di idempotenza, sicurezza e osservabilità per l'automazione operativa. Un'automazione mal progettata crea nuove modalità di guasto peggiori del toil che sostituisce.

  • Lezione 2 • Misurare l'efficacia dell'automazione

    Traccia la riduzione del toil, la copertura dell'automazione e i tassi di guasto dei sistemi automatizzati. La misurazione convalida l'investimento in automazione e fa emergere le regressioni.

  • Lezione 3 • Automatizzare i flussi di lavoro operativi

    Applica l'automazione a compiti SRE comuni come distribuzioni, ridimensionamento e bonifica. L'automazione dei flussi di lavoro libera gli ingegneri per un lavoro di reliability a maggior valore.

  • Lezione 4 • Fondamenti di Infrastructure as Code

    Introduce il provisioning dichiarativo dell'infrastruttura e la gestione della configurazione. L'IaC è la base per un'automazione dell'infrastruttura riproducibile e verificabile.

  • Lezione 5 • Identificare e quantificare il toil

    Definisce le caratteristiche del toil e i metodi di misurazione per tracciarne il costo. La quantificazione costruisce il business case per l'investimento in automazione.

Capitolo 6Vedi dettagli

Release engineering e gestione del cambiamento

  • Lezione 1 • Feature flag e dark launch

    Tratta l'architettura dei feature flag, le regole di targeting e l'igiene operativa. I flag disaccoppiano la distribuzione dal rilascio, consentendo una sperimentazione più sicura.

  • Lezione 2 • Principi di release engineering

    Stabilisce riproducibilità, build ermetiche e policy-as-code per i rilasci. Un release engineering solido previene la deriva di configurazione e i problemi della catena di fornitura.

  • Lezione 3 • Integrazione continua e distribuzione

    Tratta la progettazione della pipeline di CI, i test gate e l'ottimizzazione della frequenza di distribuzione. Una frequenza di distribuzione elevata con quality gate riduce la dimensione del batch e il blast radius.

  • Lezione 4 • Strategie di rollback e rollforward

    Definisce criteri e meccanismi per decisioni rapide di rollback e rollforward. Una capacità di rollback affidabile è la rete di sicurezza per tutte le strategie di distribuzione.

  • Lezione 5 • Strategie di distribuzione progressiva

    Insegna rilasci canary, distribuzioni blue-green e divisione del traffico. La distribuzione progressiva limita il blast radius e consente decisioni di rollout basate sui dati.

Capitolo 7Vedi dettagli

Pianificazione della capacità e ingegneria delle prestazioni

  • Lezione 1 • Tecniche di modellazione della capacità

    Introduce modelli di utilizzo delle risorse, basi di teoria delle code e obiettivi di margine di sicurezza. I modelli traducono le previsioni della domanda in decisioni concrete di provisioning.

  • Lezione 2 • Load testing e benchmarking

    Insegna la progettazione, l'esecuzione e l'interpretazione dei load test per la convalida della capacità. I load test rivelano i colli di bottiglia prima che il traffico di produzione li esponga.

  • Lezione 3 • Previsione della domanda e modellazione del carico

    Tratta l'analisi dei modelli di traffico, la modellazione della stagionalità e la proiezione della crescita. Previsioni accurate della domanda prevengono sia il sottodimensionamento che la spesa eccessiva.

  • Lezione 4 • Auto-scaling e infrastruttura elastica

    Progetta policy di auto-scaling orizzontale e verticale legate a segnali rilevanti per gli SLO. L'infrastruttura elastica assorbe i picchi di domanda controllando i costi.

  • Lezione 5 • Strategie di ottimizzazione delle prestazioni

    Tratta profilazione, caching, connection pooling e ottimizzazione delle query. I miglioramenti delle prestazioni estendono la capacità senza spesa aggiuntiva in infrastruttura.

Capitolo 8Vedi dettagli

Ingegneria della resilienza e tolleranza ai guasti

  • Lezione 1 • Fondamenti di chaos engineering

    Introduce i principi del chaos engineering, la progettazione delle ipotesi e il controllo del blast radius. L'iniezione controllata di guasti rivela punti deboli nascosti prima che lo facciano gli incidenti reali.

  • Lezione 2 • Architettura di ridondanza e failover

    Esamina i modelli di ridondanza active-active, active-passive e multi-regione. L'architettura di ridondanza determina gli obiettivi di tempo di ripristino e di perdita di dati.

  • Lezione 3 • Modelli di progettazione della resilienza

    Tratta circuit breaker, bulkhead, tentativi con backoff e timeout come primitive fondamentali di resilienza. I modelli prevengono i guasti a cascata e limitano il blast radius.

  • Lezione 4 • Gestione delle dipendenze e dei rischi

    Mappa le dipendenze esterne, valuta la probabilità di guasto e progetta controlli di mitigazione. Il rischio delle dipendenze è una causa principale di incidenti di affidabilità.

  • Lezione 5 • Pianificazione del disaster recovery

    Tratta la selezione della strategia di DR, la creazione di runbook e la cadenza regolare dei test di DR. I piani di DR non testati falliscono quando sono più necessari.

Certificazione

Il tuo certificato valido di completamento

Questo corso è per te:

  • Ingegneri DevOps: pronti ad adottare una disciplina ingegneristica più rigorosa e incentrata sull'affidabilità.

  • Sviluppatori backend: che assumono responsabilità operative e necessitano di un approccio strutturato.

  • Amministratori di sistema: in transizione dalle operazioni tradizionali alle pratiche SRE moderne.

  • Ingegneri di piattaforma: che desiderano formalizzare gli standard di affidabilità tra più team di sviluppo.

  • Responsabili dell'ingegneria: che costituiscono o supervisionano una funzione SRE per la prima volta.

  • Professionisti in cambiamento di carriera: provenienti da ambiti IT o QA e che mirano specificamente a ruoli SRE.

Cosa dicono i nostri studenti

Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...
Giulio Carlo
Giulio CarloStudente di Marketing Digitale
Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.
Mariana Ferres
Mariana FerresStudentessa di Fotografia
Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!
Luciana Alvarenga
Luciana AlvarengaStudentessa di Nail Design
La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.
André Felipe
André FelipeStudente di Prompt Engineering

Principali percorsi formativi

FAQ

Chi è Dedika?

Il certificato è valido in Italia?

I corsi sono gratuiti?

Qual è il carico di lavoro del corso?

Come sono strutturati i corsi?

Come funzionano i corsi?

Qual è la durata dei corsi?

Qual è il costo o il prezzo dei corsi?

Cos’è un corso EAD o online e come funziona?

Corso PDF