
Corso Data Engineering con Python
Padroneggi le competenze Python che i data engineer utilizzano quotidianamente — dalla creazione di pipeline ETL e connessione ai database all'orchestrazione dei flussi di lavoro e alla distribuzione di codice pronto per la produzione. Questo corso La guida dai fondamenti di Python fino ai pattern avanzati di data engineering utilizzati su larga scala.
Cosa imparerai:
Apprenderà a scrivere script Python che estraggono dati da API, file e database, per poi trasformarli e caricarli in database relazionali, data warehouse e archiviazione cloud. Lavorerà con Pandas per la manipolazione dei dati, SQLAlchemy per la connettività ai database e Apache Airflow per l'orchestrazione delle pipeline. Il corso tratta la validazione della qualità dei dati, l'ottimizzazione delle prestazioni, l'elaborazione parallela e le pratiche CI/CD per la distribuzione delle pipeline. Esplorerà inoltre PySpark per l'elaborazione distribuita, Kafka per le pipeline di streaming e le best practice di sicurezza per proteggere i dati sensibili in ambienti di produzione.
Come studi in modo pratico Corso Data Engineering con Python
Come metti in pratica Corso Data Engineering con Python
Per te che sei un'azienda e vuoi formare il tuo team
Su Dedika per aziende, il corso include esercizi ed esempi personalizzati sul tuo business e secondo le esigenze della tua azienda.
Contenuto del corso
8 Capitoli • 37 LezioniDurata tra 4 e 360 ore (decidi tu)
Capitolo 1NascondiNascondi dettagliVedi dettagliFondamenti di Python per Data Engineer
Fondamenti di Python per Data Engineer
Lezione 1 • Flusso di controllo e iterazione
Applichi condizionali, cicli e comprehension per elaborare sequenze di record di dati. Si collega direttamente alla logica di trasformazione a livello di riga utilizzata nelle pipeline ETL.
Lezione 2 • Funzioni e gestione degli errori
Definisce funzioni riutilizzabili con argomenti, valori predefiniti e valori di ritorno, quindi gestisca le eccezioni in modo elegante. Consente di scrivere codice per pipeline modulare e tollerante ai guasti.
Lezione 3 • Sintassi di base di Python e tipi di dati
Tratti variabili, operatori e tipi built-in, inclusi stringhe, interi, float e booleani. Fornisce la base sintattica per scrivere qualsiasi logica di pipeline di dati.
Lezione 4 • Collezioni: Liste, Tuple, Dizionari, Set
Esplori i tipi di collezione mutabili e immutabili e i relativi compromessi in termini di prestazioni. Queste strutture sono alla base della manipolazione dei dati in memoria durante l'intero corso.
Lezione 5 • Configurazione dell'ambiente Python
Installi Python, configuri ambienti virtuali e scelga un IDE adatto al lavoro con i dati. Stabilisce lo spazio di lavoro riproducibile da cui dipendono tutti i capitoli successivi.
Capitolo 2NascondiNascondi dettagliVedi dettagliI/O su file e serializzazione dei dati
I/O su file e serializzazione dei dati
Lezione 1 • Formati binari: Parquet e Avro
Legga e scriva file Parquet colonnari e file Avro basati su righe utilizzando librerie Python. Questi formati sono standard nelle moderne architetture di data lake.
Lezione 2 • Lavorare con file di testo e CSV
Apra, legga e scriva file di testo utilizzando i context manager, quindi analizzi i CSV con la libreria standard. Tratta il formato di dati grezzi più comune nelle pipeline batch.
Lezione 3 • Operazioni su file system e percorsi
Navighi tra le directory, utilizzi glob per i file e gestisca i percorsi usando i moduli pathlib e os. Automatizza le fasi di individuazione dei file comuni nei flussi di lavoro di ingestione batch.
Lezione 4 • Formati dati JSON e XML
Analizzi e serializzi payload JSON e navighi tra gli alberi XML per l'elaborazione di API e file di configurazione. Si collega all'ingestione reale delle risposte delle API REST.
Capitolo 3NascondiNascondi dettagliVedi dettagliManipolazione dei dati con Pandas
Manipolazione dei dati con Pandas
Lezione 1 • Fondamenti di DataFrame e Series
Crei DataFrame da dict, CSV e JSON, quindi ispezioni la struttura e i tipi di dati. Costituisce la base per tutto il lavoro di trasformazione basato su Pandas.
Lezione 2 • Filtraggio, ordinamento e selezione
Applichi maschere booleane, selettori loc/iloc e operazioni di ordinamento per isolare sottoinsiemi di dati rilevanti. Supporta direttamente il filtraggio per la qualità dei dati nelle fasi della pipeline.
Lezione 3 • Aggregazione, raggruppamento e pivot
Riassuma i dati con operazioni groupby, agg e pivot per produrre output analitici. Consente il calcolo di metriche e la reportistica all'interno dei flussi di lavoro della pipeline.
Lezione 4 • Pulizia dei dati e coercizione dei tipi
Gestisca valori mancanti, duplicati e tipi errati per produrre dataset puliti e coerenti. La pulizia è la fase che richiede più tempo nelle pipeline di dati reali.
Lezione 5 • Unione e join di DataFrame
Combini dataset utilizzando merge, join e concat per replicare la logica relazionale in stile SQL. Essenziale per denormalizzare i dati prima del caricamento in archivi analitici.
Capitolo 4NascondiNascondi dettagliVedi dettagliConnettività ai database e integrazione SQL
Connettività ai database e integrazione SQL
Lezione 1 • Lavorare con database NoSQL
Si connetta ad archivi documentali e chiave-valore, esegua operazioni CRUD e mappi i risultati su oggetti Python. Estende la connettività della pipeline oltre i sistemi relazionali.
Lezione 2 • Database relazionali con SQLAlchemy
Stabilisca connessioni, rifletta gli schemi ed esegua SQL grezzo utilizzando l'API core di SQLAlchemy. Fornisce un livello di accesso indipendente dal database per il codice della pipeline.
Lezione 3 • Pool di connessioni e best practice
Configuri i pool di connessioni, gestisca le credenziali in modo sicuro ed eviti gli anti-pattern comuni. Garantisce affidabilità e sicurezza di livello produttivo nel codice di accesso al database.
Lezione 4 • Scrittura e upsert dei dati
Inserisca, aggiorni ed esegua l'upsert dei record a livello di codice utilizzando SQLAlchemy e Pandas to_sql. Tratta il percorso di scrittura richiesto per caricare gli output della pipeline nei database.
Capitolo 5NascondiNascondi dettagliVedi dettagliCostruzione di pipeline ETL in Python
Costruzione di pipeline ETL in Python
Lezione 1 • Logging e osservabilità della pipeline
Strumenta le pipeline con logging strutturato, metriche e avvisi per consentire il monitoraggio operativo. Trasforma gli script in processi osservabili e pronti per la produzione.
Lezione 2 • Logica di trasformazione e regole di business
Implementa mappature di campi, colonne derivate e regole di convalida come pure funzioni Python. Incapsula la logica di business in unità di trasformazione testabili e riutilizzabili.
Lezione 3 • Caricamento dei dati nei sistemi di destinazione
Scrivi i dati trasformati in database, data warehouse e object storage utilizzando connettori Python. Completa la pipeline consegnando dati puliti alla loro destinazione.
Lezione 4 • Architettura ETL e pattern di progettazione
Comprendi le fasi della pipeline, il flusso di dati e i pattern di progettazione comuni come ELT e l'architettura medallion. Definisce il quadro concettuale per tutto il lavoro di implementazione della pipeline.
Lezione 5 • Estrazione di dati dalle API
Recupera dati da API REST utilizzando la libreria requests, gestisca la paginazione e amministri i limiti di frequenza. Tratta la sorgente di dati moderna più comune per le pipeline di ingestione.
Capitolo 6NascondiNascondi dettagliVedi dettagliLavorare con archiviazione e servizi cloud
Lavorare con archiviazione e servizi cloud
Lezione 1 • Infrastructure as Code per pipeline di dati
Definisci le risorse cloud a livello di codice utilizzando strumenti IaC basati su Python per automatizzare la configurazione dell'ambiente. Riduce il provisioning manuale e garantisce un'infrastruttura di pipeline riproducibile.
Lezione 2 • Ingestione guidata dagli eventi con code di messaggi
Produci e consumi messaggi da code e argomenti di streaming per attivare l'esecuzione della pipeline. Collega le pipeline Python ad architetture di dati guidate dagli eventi e in tempo reale.
Lezione 3 • Interagisci con data warehouse gestiti
Si connetta ai data warehouse cloud tramite connettori Python, esegua query e carichi i dati in modo efficiente. Consente alle pipeline Python di servire carichi di lavoro analitici su larga scala.
Lezione 4 • Object storage cloud con SDK Python
Carica, scarica, elenca ed elimina oggetti nei bucket di archiviazione cloud utilizzando gli SDK del fornitore. L'object storage è la zona di atterraggio principale per i dati grezzi nelle pipeline cloud.
Capitolo 7NascondiNascondi dettagliVedi dettagliOrchestrazione e schedulazione delle pipeline
Orchestrazione e schedulazione delle pipeline
Lezione 1 • Gestione degli errori e strategie di retry
Configura tentativi, timeout e avvisi SLA per rendere le pipeline orchestrate resilienti ai guasti transitori. Riduce direttamente l'intervento manuale negli ambienti di produzione.
Lezione 2 • DAG dinamici e parametrizzazione
Genera DAG a livello di codice e passa parametri di runtime alle attività per un'esecuzione flessibile della pipeline. Consente l'orchestrazione scalabile di molte varianti di pipeline simili.
Lezione 3 • Concetti di orchestrazione e panorama degli strumenti
Comprendi i DAG, le dipendenze tra attività e il ruolo degli orchestratori nel data engineering. Fornisce le basi concettuali prima di implementare il codice di orchestrazione.
Lezione 4 • Costruzione di DAG con Apache Airflow
Definisci DAG, operatori e dipendenze tra attività in Airflow utilizzando Python per schedulare l'esecuzione delle pipeline. Airflow è l'orchestratore più diffusamente utilizzato nel data engineering.
Lezione 5 • Monitoraggio e avvisi nell'orchestrazione
Utilizza le UI dell'orchestratore, i log e le integrazioni di avviso esterne per tracciare lo stato di salute della pipeline. Chiude il ciclo di osservabilità per le operazioni end-to-end della pipeline.
Capitolo 8NascondiNascondi dettagliVedi dettagliPrestazioni, test e prontezza per la produzione
Prestazioni, test e prontezza per la produzione
Lezione 1 • Qualità del codice e packaging
Imponga lo stile con i linter, esegua il controllo dei tipi con mypy e impacchetti il codice della pipeline come moduli Python installabili. Eleva la manutenibilità del codice agli standard professionali dell'ingegneria del software.
Lezione 2 • Test unitari e di integrazione per le pipeline
Scriva test unitari basati su pytest per le funzioni di trasformazione e test di integrazione per le interazioni con il database. I test prevengono le regressioni e convalidano la correttezza della pipeline.
Lezione 3 • Elaborazione parallela e concorrente
Applica modelli di multiprocessing, threading e asincroni per parallelizzare le attività di pipeline I/O-bound e CPU-bound. Riduce significativamente il tempo di esecuzione end-to-end della pipeline.
Lezione 4 • Profilazione e ottimizzazione del codice Python
Identifichi i colli di bottiglia utilizzando strumenti di profilazione e applichi vettorizzazione, suddivisione in blocchi e caching per migliorare il throughput. L'ottimizzazione delle prestazioni è fondamentale per le pipeline di dati su larga scala.
Lezione 5 • CI/CD per la distribuzione di pipeline di dati
Automatizzi test, linting e distribuzione del codice della pipeline utilizzando pipeline CI/CD attivate da eventi di controllo versione. Consente rilasci di produzione sicuri e ripetibili.
Il tuo certificato valido di completamento
Questo corso è per te:
Analista dati junior: pronto ad automatizzare flussi di lavoro ripetitivi con Python.
Sviluppatore SQL: desidera ampliare le proprie competenze nella costruzione programmatica di pipeline.
Sviluppatore software: si sta orientando verso l'ingegneria dei dati a partire da un background di programmazione generica.
Ingegnere di business intelligence: desidera gestire l'intera pipeline di dati end-to-end.
Neolaureato in informatica: in cerca di un'esperienza pratica e immediatamente spendibile nel data engineering.
Programmatrice autodidatta: appassionata di dati e con l'obiettivo di un ruolo nell'ingegneria.
Cosa dicono i nostri studenti
Le sue lezioni sono perfette. Ho acquistato il pacchetto annuale e finalmente ho l'opportunità di seguire diversi argomenti di mio interesse senza dover cambiare piattaforma... vi ringrazio per tutto quello che fate, vi ho già raccomandati ad altre persone...

Mi piace come le lezioni vanno dritte al punto e come riesco a cambiare capitoli e saltare contenuti di cui non ho bisogno.

Mi piace il contenuto e il modo di presentazione e trascrizione dei video, che accelera il processo!

La piattaforma è veloce, semplice da usare. La diversità dei contenuti e i video complementari aiutano molto nell'apprendimento.

Principali percorsi formativi
FAQ
Chi è Dedika?
Il certificato è valido in Italia?
I corsi sono gratuiti?
Qual è il carico di lavoro del corso?
Come sono strutturati i corsi?
Come funzionano i corsi?
Qual è la durata dei corsi?
Qual è il costo o il prezzo dei corsi?
Cos’è un corso EAD o online e come funziona?
Corso PDF




















