
Formare Databricks
Stăpâniți platforma Databricks de la zero — acoperind arhitectura lakehouse, Apache Spark, Delta Lake și fluxurile de lucru ML. Această formare echipează inginerii de date, analiștii și oamenii de știință a datelor cu competențele practice necesare pentru a construi pipeline-uri de producție și soluții de analiză. Dacă lucrați cu date la scară mare, aceasta este formarea care vă propulsează cariera mai departe.
Ce vei învăța:
Acest curs acoperă fiecare strat major al platformei Databricks, începând cu arhitectura lakehouse și fundamentele workspace-ului. Veți scrie și optimiza joburi Apache Spark, veți gestiona tabele Delta Lake și veți construi pipeline-uri ETL fiabile folosind Auto Loader și Delta Live Tables. Veți aplica arhitectura medallion pentru a organiza datele în straturi Bronze, Silver și Gold. Cursul acoperă, de asemenea, Databricks SQL pentru analize, MLflow pentru gestionarea ciclului de viață al machine learning-ului și orchestrarea fluxurilor de lucru pentru deployment-uri în producție. Subiectele avansate includ ajustarea performanței Spark, guvernanța Unity Catalog, streaming-ul Kafka în timp real și inteligența artificială generativă cu Mosaic AI.
Cum studiezi practic Formare Databricks
Cum exersezi Formare Databricks
Pentru tine, care reprezinți o companie și vrei să îți instruiești echipa
La Dedika pentru companii, cursul vine cu exerciții și exemple adaptate afacerii tale și exact așa cum are nevoie compania ta.
Conținutul cursului
8 Capitole • 40 LecțiiDurata între 4 și 360 ore (tu decizi)
Capitolul 1AscundeAscunde detaliiVezi detaliiIntroducere în Databricks și Lakehouse
Introducere în Databricks și Lakehouse
Lecția 1 • Navigarea în spațiul de lucru Databricks
Acoperă interfața utilizator a spațiului de lucru, organizarea resurselor și rolurile utilizatorilor. Cursanții dobândesc familiarizare practică cu mediul înainte de a scrie orice cod.
Lecția 2 • Conectarea la surse de date
Demonstrează montarea stocării în cloud și conectarea la baze de date externe. Stabilește modelele de acces la date necesare pentru toate sarcinile de inginerie a datelor și analiză.
Lecția 3 • Ce este arhitectura Lakehouse
Definește paradigma lakehouse și o contrastează cu depozitele de date și lacurile de date. Stabilește contextul arhitectural pentru toate lucrările ulterioare cu Databricks.
Lecția 4 • Lucrul cu notebook-urile Databricks
Introduce crearea notebook-urilor, comenzile magice și suportul pentru mai multe limbaje. Notebook-urile sunt interfața principală de dezvoltare utilizată în fiecare capitol următor.
Lecția 5 • Cluster-e: configurare și gestionare
Explică tipurile de cluster-e, opțiunile de configurare și gestionarea ciclului de viață. Configurarea corectă a cluster-ului este esențială pentru utilizarea eficientă a resurselor pe parcursul cursului.
Capitolul 2AscundeAscunde detaliiVezi detaliiFundamentele Apache Spark în Databricks
Fundamentele Apache Spark în Databricks
Lecția 1 • Citirea și scrierea formatelor de date
Acoperă citirea și scrierea formatelor Parquet, JSON, CSV și Delta cu opțiuni. Gestionarea corectă a formatelor este fundamentală pentru toate pipeline-urile de ingerare și ieșire.
Lecția 2 • DataFrames și API-ul DataFrame
Acoperă crearea DataFrames, inferarea schemei și transformările de bază. DataFrames sunt abstracția principală utilizată în toate capitolele de procesare a datelor.
Lecția 3 • Bazele performanței Spark
Introduce partiționarea, caching-ul și broadcast join-urile pentru reglarea performanței. Aceste tehnici sunt aplicate în capitolele avansate de optimizare ulterioare ale cursului.
Lecția 4 • Arhitectura Spark și modelul de execuție
Explică rolurile driver-ului și executor-ului, DAG-urile și evaluarea leneșă. Înțelegerea fluxului de execuție este esențială pentru scrierea de cod Spark eficient în capitolele următoare.
Lecția 5 • Spark SQL pentru interogarea datelor
Învață interogarea bazată pe SQL deasupra Spark folosind vizualizări temporare și tabele de catalog. Face legătura între competențele SQL și motorul de execuție Spark.
Capitolul 3AscundeAscunde detaliiVezi detaliiDelta Lake: stocare fiabilă a datelor
Delta Lake: stocare fiabilă a datelor
Lecția 1 • Operații DML pe tabele Delta
Învață operațiile INSERT, UPDATE, DELETE și MERGE pe tabelele Delta. Permite cursanților să implementeze modele de upsert esențiale pentru pipeline-urile de date incrementale.
Lecția 2 • Optimizarea tabelelor Delta
Acoperă comenzile OPTIMIZE, ZORDER și VACUUM pentru gestionarea performanței și stocării. Aceste operații sunt esențiale pentru menținerea tabelelor Delta de nivel de producție.
Lecția 3 • Călătoria în timp și versionarea datelor
Demonstrează interogarea versiunilor istorice ale tabelelor și restaurarea stărilor anterioare. Călătoria în timp sprijină auditul și recuperarea erorilor în pipeline-urile de date de producție.
Lecția 4 • Crearea și gestionarea tabelelor Delta
Acoperă operațiile DDL, proprietățile tabelelor și tabelele gestionate vs. externe. Aceste competențe sunt necesare pentru construirea straturilor de date structurate în capitolele ulterioare de pipeline.
Lecția 5 • Concepte de bază ale Delta Lake
Explică jurnalul de tranzacții Delta, garanțiile ACID și modul în care Delta diferă de Parquet simplu. Oferă fundația conceptuală pentru toate operațiile cu tabele Delta.
Capitolul 4AscundeAscunde detaliiVezi detaliiIngerarea datelor și pipeline-uri ETL
Ingerarea datelor și pipeline-uri ETL
Lecția 1 • Auto Loader pentru ingerare incrementală
Introduce modurile de notificare a fișierelor și de listare a directoarelor ale Auto Loader pentru ingerare scalabilă. Auto Loader este modelul recomandat de Databricks pentru ingerarea continuă pe bază de fișiere.
Lecția 2 • Modele de ingerare în lot
Acoperă strategiile de încărcare completă și incrementală folosind Spark și Delta. Stabilește modelele de ingerare care stau la baza tuturor arhitecturilor de pipeline din acest capitol.
Lecția 3 • Construirea logicii de transformare
Acoperă modelele de transformare în mai mulți pași, inclusiv curățarea, îmbogățirea și deduplicarea. Logica de transformare este stratul de valoare adăugată principal în orice pipeline ETL.
Lecția 4 • Delta Live Tables pentru orchestrarea pipeline-urilor
Introduce Delta Live Tables (DLT) pentru definirea declarativă a pipeline-urilor și impunerea calității. DLT simplifică gestionarea pipeline-urilor și se integrează cu arhitectura medalion.
Lecția 5 • Fundamentele Structured Streaming
Învață streamingul micro-batch și continuu cu Spark Structured Streaming. Oferă fundația de streaming necesară pentru secțiunile viitoare de pipeline în timp real.
Capitolul 5AscundeAscunde detaliiVezi detaliiModelarea datelor și arhitectura medalion
Modelarea datelor și arhitectura medalion
Lecția 1 • Principii ale arhitecturii medalion
Definește responsabilitățile straturilor Bronz, Argint și Aur și contractele de date. Oferă cadrul structural aplicat în fiecare secțiune ulterioară de modelare și pipeline.
Lecția 2 • Proiectarea stratului Bronz
Acoperă aterizarea datelor brute, schema-on-read și păstrarea fidelității sursei. Un strat Bronz bine proiectat asigură auditabilitate completă și capacitate de reprocesare.
Lecția 3 • Construirea agregatelor stratului Aur
Acoperă construirea tabelelor pre-agregate, denormalizate, optimizate pentru BI și raportare. Tabelele Aur reduc complexitatea interogărilor și îmbunătățesc performanța tablourilor de bord.
Lecția 4 • Construirea stratului Argint
Învață curățarea, conversia tipurilor, deduplicarea și conformarea datelor la o schemă unificată. Stratul Argint este sursa principală pentru sarcinile de lucru analitice și ML.
Lecția 5 • Calitatea datelor și așteptările
Introduce impunerea constrângerilor, modelele de carantină și urmărirea metricilor de calitate. Încorporarea verificărilor de calitate în fiecare strat împiedică propagarea datelor proaste în aval.
Capitolul 6AscundeAscunde detaliiVezi detaliiDatabricks SQL și analiză
Databricks SQL și analiză
Lecția 1 • Optimizarea interogărilor pentru analiză
Învață analiza planurilor de execuție, strategii de caching și caching al rezultatelor pentru sarcini de lucru SQL. Interogările optimizate reduc costurile depozitelor și îmbunătățesc experiența utilizatorului.
Lecția 2 • Construirea tablourilor de bord și a vizualizărilor
Acoperă crearea de diagrame, tablouri de bord și alerte în cadrul Databricks SQL. Tablourile de bord permit părților interesate de business să consume date fără a scrie cod.
Lecția 3 • Unity Catalog pentru guvernanța datelor
Introduce spațiul de nume pe trei niveluri al Unity Catalog, controlul accesului și proveniența datelor. Guvernanța este fundamentală pentru analiza securizată și conformă între echipe.
Lecția 4 • Tehnici SQL avansate în Databricks
Învață funcții de fereastră, CTE-uri și funcții de ordin superior pentru interogări analitice complexe. Aceste tehnici permit analize sofisticate direct în Databricks SQL.
Lecția 5 • Depozite SQL și execuția interogărilor
Acoperă tipurile de depozite SQL, dimensionarea și rutarea interogărilor. Configurarea corectă a depozitului are un impact direct asupra performanței interogărilor și costurilor pentru sarcinile de lucru analitice.
Capitolul 7AscundeAscunde detaliiVezi detaliiMachine learning cu Databricks și MLflow
Machine learning cu Databricks și MLflow
Lecția 1 • Registrul de modele MLflow
Introduce înregistrarea modelelor, tranzițiile între etape și gestionarea versiunilor în Registrul de modele. Registrul oferă guvernanță și trasabilitate pentru modelele de producție.
Lecția 2 • Servirea modelelor și inferența în lot
Acoperă endpoint-urile de servire a modelelor în timp real și inferența în lot cu Spark. Implementarea modelelor în ambele moduri asigură flexibilitate pentru diverse cerințe de business.
Lecția 3 • Antrenarea modelelor la scară cu Spark
Acoperă antrenarea distribuită folosind pandas UDF-uri, Spark ML și Hyperopt pentru reglare. Antrenarea distribuită reduce timpul până la obținerea de informații pe seturi mari de date.
Lecția 4 • Urmărirea experimentelor cu MLflow
Învață înregistrarea parametrilor, metricilor și artefactelor cu MLflow Tracking. Urmărirea sistematică a experimentelor permite reproductibilitatea și selectarea informată a modelelor.
Lecția 5 • ML Runtime Databricks și ingineria caracteristicilor
Acoperă mediul ML Runtime, bibliotecile pre-instalate și elementele de bază ale Feature Store. Un set de caracteristici bine pregătit este fundația antrenării reproductibile a modelelor.
Capitolul 8AscundeAscunde detaliiVezi detaliiOrchestrarea fluxurilor de lucru și implementarea în producție
Orchestrarea fluxurilor de lucru și implementarea în producție
Lecția 1 • Monitorizare, înregistrare și gestionarea costurilor
Acoperă jurnalele de evenimente ale cluster-elor, metricile job-urilor, jurnalele de audit și urmărirea costurilor DBU. Observabilitatea și controlul costurilor sunt esențiale pentru operațiunile de producție sustenabile.
Lecția 2 • Planificarea și declanșarea fluxurilor de lucru
Învață planificarea bazată pe cron, declanșatoarele de sosire a fișierelor și declanșatoarele API externe. Declanșarea flexibilă asigură că pipeline-urile rulează la momentul potrivit cu intervenție manuală minimă.
Lecția 3 • Infrastructură ca cod cu Terraform
Introduce furnizarea resurselor Databricks folosind provider-ul Terraform. Infrastructura ca cod asigură configurarea reproductibilă și auditabilă a mediilor în diferite spații de lucru.
Lecția 4 • Job-uri Databricks și orchestrarea sarcinilor
Acoperă crearea job-urilor cu mai multe sarcini, setarea dependențelor și configurarea calculului pentru fiecare sarcină. Job-urile sunt mecanismul principal pentru rularea sarcinilor de lucru de producție conform unei programări.
Lecția 5 • CI/CD pentru Databricks cu Repos
Acoperă integrarea Git prin Databricks Repos, strategii de branch și implementare automatizată. Practicile CI/CD reduc riscul de implementare și accelerează livrarea produselor de date.
Certificatul tău valid de finalizare
Acest curs este pentru tine:
Inginer de date: pregătit să treacă dincolo de pipeline-urile de bază către o platformă lakehouse unificată.
Analist de date: dorește să interogheze și să vizualizeze date la scară folosind Databricks SQL.
Om de știință a datelor: are nevoie de o platformă fiabilă pentru ingineria caracteristicilor și deployment-ul modelelor.
Inginer de analiză: construiește straturi de transformare de tip dbt și explorează alternative native Spark.
Inginer cloud: sprijină echipele de date și are nevoie de cunoștințe mai aprofundate despre infrastructura Databricks.
Persoană în reconversie profesională: face tranziția de la dezvoltarea software către ingineria modernă a datelor.
Ce spun cursanții noștri
Lecțiile dumneavoastră sunt perfecte. Am achiziționat pachetul de un an și, în sfârșit, am oportunitatea să urmăresc diverse subiecte de interes fără să fie nevoie să schimb platforma... vă mulțumesc pentru tot ceea ce faceți, v-am recomandat deja altor persoane...

Îmi place cum lecțiile sunt directe la subiect și cum pot să schimb capitolele și să sar peste conținutul de care nu am nevoie.

Îmi place conținutul și modul de prezentare și transcriere a videoclipurilor, ceea ce accelerează procesul!

Platforma este rapidă, simplă de utilizat. Diversitatea conținutului și videoclipurile complementare ajută foarte mult la învățare.

Cele mai importante formări
Întrebări frecvente
Cine este Dedika?
Este certificatul valabil în România?
Cursurile sunt gratuite?
Care este volumul de muncă al cursului?
Cum sunt cursurile?
Cum funcționează cursurile?
Care este durata cursurilor?
Care este costul sau prețul cursurilor?
Ce este un curs EAD sau online și cum funcționează?
Curs PDF




















