
Corso di Site Reliability Engineering
Padroneggi la disciplina ingegneristica che mantiene in funzione i sistemi più critici al mondo. Questo corso Le fornisce i framework, gli strumenti e le pratiche concrete utilizzate dai team SRE su larga scala — dagli SLO e gli error budget fino al comando degli incidenti e al chaos engineering. Sia che stia passando a un ruolo SRE o che stia migliorando la sua posizione attuale, questa è la base strutturata di cui ha bisogno.
Cosa imparerai:
Costruirà un set completo di competenze SRE partendo dai principi fondamentali, SLI, SLO ed error budget, per poi passare all'osservabilità, alla progettazione degli avvisi e alla gestione della reperibilità. Imparerà a guidare la risposta agli incidenti, a condurre postmortem senza colpevolizzazione e a promuovere il miglioramento continuo. Il corso tratta la riduzione del lavoro ripetitivo, l'automazione dell'infrastruttura, la distribuzione progressiva e la pianificazione della capacità. Esplorerà anche l'ingegneria della resilienza, gli esperimenti di chaos, l'affidabilità di Kubernetes e le tecniche di AIOps. Alla fine, avrà la profondità tecnica e le capacità organizzative per costruire e scalare sistemi affidabili.
Come studi in modo pratico Corso di Site Reliability Engineering
Come metti in pratica Corso di Site Reliability Engineering
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 38 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliFondamenti di Site Reliability Engineering
Fondamenti di Site Reliability Engineering
Lezione 1 • Struttura e ruoli del team SRE
Esamina come i team SRE sono organizzati, dimensionati e inseriti nelle organizzazioni. Chiarisce i confini di ruolo con i team di sviluppo e piattaforma.
Lezione 2 • Concetti e terminologia chiave dell'SRE
Definisce SLI, SLO, SLA, error budget e toil. Un vocabolario condiviso consente una comunicazione precisa tra i team di ingegneria e di business.
Lezione 3 • Cultura della reliability e incentivi
Esplora la sicurezza psicologica, la cultura blameless e l'allineamento degli incentivi. Le basi culturali determinano se le pratiche tecniche avranno successo o falliranno.
Lezione 4 • Origini e filosofia dell'SRE
Traccia l'emergere dell'SRE dall'ingegneria del software applicata alle operations. Fornisce il contesto storico che inquadra ogni successiva pratica tecnica.
Capitolo 2NascondiNascondi dettagliVedi dettagliMisurare la reliability con SLI e SLO
Misurare la reliability con SLI e SLO
Lezione 1 • Politica e gestione degli error budget
Definisce come gli error budget sono calcolati, tracciati e applicati. Gli error budget traducono obiettivi astratti di reliability in decisioni ingegneristiche attuabili.
Lezione 2 • Stabilire obiettivi SLO realistici
Tratta la negoziazione, la baseline e il perfezionamento iterativo dei valori SLO. Gli obiettivi devono bilanciare le aspettative degli utenti con la fattibilità ingegneristica.
Lezione 3 • Scegliere SLI significativi
Guida la selezione di metriche che riflettono accuratamente l'esperienza utente. Una scelta inadeguata degli SLI mina l'intero sistema di misurazione della reliability.
Lezione 4 • Dashboard SLO e reporting
Insegna la costruzione di dashboard SLO e pipeline di reporting automatizzato. La visibilità garantisce che i team agiscano sui dati di reliability anziché ignorarli.
Capitolo 3NascondiNascondi dettagliVedi dettagliMonitoraggio, osservabilità e allerta
Monitoraggio, osservabilità e allerta
Lezione 1 • Gestione della reperibilità e runbook
Struttura i turni di reperibilità, i percorsi di escalation e la creazione di runbook. Pratiche di reperibilità efficaci riducono il tempo medio di risoluzione e il burnout degli ingegneri.
Lezione 2 • Pilastri dell'osservabilità: metriche, log, tracce
Introduce i tre pilastri dell'osservabilità e i loro ruoli complementari. Comprendere ciascun pilastro previene l'eccessivo affidamento su una singola fonte di dati.
Lezione 3 • Architettura del sistema di monitoraggio
Esamina architetture di monitoraggio scalabili, inclusi i modelli push vs. pull e l'archiviazione a lungo termine. Le scelte architetturali influenzano costi, reliability e prestazioni delle query.
Lezione 4 • Strumentazione e raccolta dati
Tratta le tecniche di strumentazione a livello di codice e di infrastruttura. Una corretta strumentazione è il prerequisito per un'osservabilità significativa.
Lezione 5 • Progettazione efficace degli allarmi
Insegna l'allerta basata sui sintomi, gli avvisi multi-finestra sul tasso di consumo e l'instradamento degli allarmi. Allarmi ben progettati riducono l'affaticamento da reperibilità e migliorano il tempo di risposta.
Capitolo 4NascondiNascondi dettagliVedi dettagliGestione e risposta agli incidenti
Gestione e risposta agli incidenti
Lezione 1 • Tecniche di diagnosi e mitigazione
Insegna la diagnosi sistematica utilizzando dati di osservabilità e debugging guidato da ipotesi. Una mitigazione rapida limita l'impatto sugli utenti mentre l'analisi della causa radice continua.
Lezione 2 • Comando e coordinamento degli incidenti
Tratta i ruoli di incident commander, responsabile della comunicazione e scriba. Un'assegnazione chiara dei ruoli previene la confusione e accelera la risoluzione durante eventi ad alto stress.
Lezione 3 • Postmortem blameless
Guida la scrittura e la facilitazione di postmortem blameless che producono miglioramenti attuabili. I postmortem sono il meccanismo principale per l'apprendimento organizzativo.
Lezione 4 • Classificazione e gravità degli incidenti
Definisce i livelli di gravità, i criteri di impatto e le procedure di triage. Una classificazione coerente garantisce una risposta e un'allocazione delle risorse proporzionate.
Lezione 5 • Metriche degli incidenti e miglioramento continuo
Traccia MTTD, MTTR e frequenza degli incidenti per misurare l'efficacia della risposta. L'analisi delle tendenze guida miglioramenti mirati a processi e strumenti.
Capitolo 5NascondiNascondi dettagliVedi dettagliRiduzione del toil e automazione
Riduzione del toil e automazione
Lezione 1 • Principi di progettazione dell'automazione
Tratta i requisiti di idempotenza, sicurezza e osservabilità per l'automazione operativa. Un'automazione mal progettata crea nuove modalità di guasto peggiori del toil che sostituisce.
Lezione 2 • Misurare l'efficacia dell'automazione
Traccia la riduzione del toil, la copertura dell'automazione e i tassi di guasto dei sistemi automatizzati. La misurazione convalida l'investimento in automazione e fa emergere le regressioni.
Lezione 3 • Automatizzare i flussi di lavoro operativi
Applica l'automazione a compiti SRE comuni come distribuzioni, ridimensionamento e bonifica. L'automazione dei flussi di lavoro libera gli ingegneri per un lavoro di reliability a maggior valore.
Lezione 4 • Fondamenti di Infrastructure as Code
Introduce il provisioning dichiarativo dell'infrastruttura e la gestione della configurazione. L'IaC è la base per un'automazione dell'infrastruttura riproducibile e verificabile.
Lezione 5 • Identificare e quantificare il toil
Definisce le caratteristiche del toil e i metodi di misurazione per tracciarne il costo. La quantificazione costruisce il business case per l'investimento in automazione.
Capitolo 6NascondiNascondi dettagliVedi dettagliRelease engineering e gestione del cambiamento
Release engineering e gestione del cambiamento
Lezione 1 • Feature flag e dark launch
Tratta l'architettura dei feature flag, le regole di targeting e l'igiene operativa. I flag disaccoppiano la distribuzione dal rilascio, consentendo una sperimentazione più sicura.
Lezione 2 • Principi di release engineering
Stabilisce riproducibilità, build ermetiche e policy-as-code per i rilasci. Un release engineering solido previene la deriva di configurazione e i problemi della catena di fornitura.
Lezione 3 • Integrazione continua e distribuzione
Tratta la progettazione della pipeline di CI, i test gate e l'ottimizzazione della frequenza di distribuzione. Una frequenza di distribuzione elevata con quality gate riduce la dimensione del batch e il blast radius.
Lezione 4 • Strategie di rollback e rollforward
Definisce criteri e meccanismi per decisioni rapide di rollback e rollforward. Una capacità di rollback affidabile è la rete di sicurezza per tutte le strategie di distribuzione.
Lezione 5 • Strategie di distribuzione progressiva
Insegna rilasci canary, distribuzioni blue-green e divisione del traffico. La distribuzione progressiva limita il blast radius e consente decisioni di rollout basate sui dati.
Capitolo 7NascondiNascondi dettagliVedi dettagliPianificazione della capacità e ingegneria delle prestazioni
Pianificazione della capacità e ingegneria delle prestazioni
Lezione 1 • Tecniche di modellazione della capacità
Introduce modelli di utilizzo delle risorse, basi di teoria delle code e obiettivi di margine di sicurezza. I modelli traducono le previsioni della domanda in decisioni concrete di provisioning.
Lezione 2 • Load testing e benchmarking
Insegna la progettazione, l'esecuzione e l'interpretazione dei load test per la convalida della capacità. I load test rivelano i colli di bottiglia prima che il traffico di produzione li esponga.
Lezione 3 • Previsione della domanda e modellazione del carico
Tratta l'analisi dei modelli di traffico, la modellazione della stagionalità e la proiezione della crescita. Previsioni accurate della domanda prevengono sia il sottodimensionamento che la spesa eccessiva.
Lezione 4 • Auto-scaling e infrastruttura elastica
Progetta policy di auto-scaling orizzontale e verticale legate a segnali rilevanti per gli SLO. L'infrastruttura elastica assorbe i picchi di domanda controllando i costi.
Lezione 5 • Strategie di ottimizzazione delle prestazioni
Tratta profilazione, caching, connection pooling e ottimizzazione delle query. I miglioramenti delle prestazioni estendono la capacità senza spesa aggiuntiva in infrastruttura.
Capitolo 8NascondiNascondi dettagliVedi dettagliIngegneria della resilienza e tolleranza ai guasti
Ingegneria della resilienza e tolleranza ai guasti
Lezione 1 • Fondamenti di chaos engineering
Introduce i principi del chaos engineering, la progettazione delle ipotesi e il controllo del blast radius. L'iniezione controllata di guasti rivela punti deboli nascosti prima che lo facciano gli incidenti reali.
Lezione 2 • Architettura di ridondanza e failover
Esamina i modelli di ridondanza active-active, active-passive e multi-regione. L'architettura di ridondanza determina gli obiettivi di tempo di ripristino e di perdita di dati.
Lezione 3 • Modelli di progettazione della resilienza
Tratta circuit breaker, bulkhead, tentativi con backoff e timeout come primitive fondamentali di resilienza. I modelli prevengono i guasti a cascata e limitano il blast radius.
Lezione 4 • Gestione delle dipendenze e dei rischi
Mappa le dipendenze esterne, valuta la probabilità di guasto e progetta controlli di mitigazione. Il rischio delle dipendenze è una causa principale di incidenti di affidabilità.
Lezione 5 • Pianificazione del disaster recovery
Tratta la selezione della strategia di DR, la creazione di runbook e la cadenza regolare dei test di DR. I piani di DR non testati falliscono quando sono più necessari.
Il tuo certificato valido di completamento
Questo corso è per te:
Ingegneri DevOps: pronti ad adottare una disciplina ingegneristica più rigorosa e incentrata sull'affidabilità.
Sviluppatori backend: che assumono responsabilità operative e necessitano di un approccio strutturato.
Amministratori di sistema: in transizione dalle operazioni tradizionali alle pratiche SRE moderne.
Ingegneri di piattaforma: che desiderano formalizzare gli standard di affidabilità tra più team di sviluppo.
Responsabili dell'ingegneria: che costituiscono o supervisionano una funzione SRE per la prima volta.
Professionisti in cambiamento di carriera: provenienti da ambiti IT o QA e che mirano specificamente a ruoli SRE.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















