Alegeți limba dvs.
Formare Databricks
Peste 2 milioane de cursanți în întreaga lume

Formare Databricks

Stăpâniți platforma Databricks de la zero — acoperind arhitectura lakehouse, Apache Spark, Delta Lake și fluxurile de lucru ML. Această formare echipează inginerii de date, analiștii și oamenii de știință a datelor cu competențele practice necesare pentru a construi pipeline-uri de producție și soluții de analiză. Dacă lucrați cu date la scară mare, aceasta este formarea care vă propulsează cariera mai departe.

Dedika pentru companii

Ce vei învăța:

Acest curs acoperă fiecare strat major al platformei Databricks, începând cu arhitectura lakehouse și fundamentele workspace-ului. Veți scrie și optimiza joburi Apache Spark, veți gestiona tabele Delta Lake și veți construi pipeline-uri ETL fiabile folosind Auto Loader și Delta Live Tables. Veți aplica arhitectura medallion pentru a organiza datele în straturi Bronze, Silver și Gold. Cursul acoperă, de asemenea, Databricks SQL pentru analize, MLflow pentru gestionarea ciclului de viață al machine learning-ului și orchestrarea fluxurilor de lucru pentru deployment-uri în producție. Subiectele avansate includ ajustarea performanței Spark, guvernanța Unity Catalog, streaming-ul Kafka în timp real și inteligența artificială generativă cu Mosaic AI.

Cum studiezi practic Formare Databricks

Cum exersezi Formare Databricks

Pentru tine, care reprezinți o companie și vrei să îți instruiești echipa

La Dedika pentru companii, cursul vine cu exerciții și exemple adaptate afacerii tale și exact așa cum are nevoie compania ta.

Apasă aici

Conținutul cursului

8 Capitole • 40 LecțiiDurata între 4 și 360 ore (tu decizi)

Capitolul 1Vezi detalii

Introducere în Databricks și Lakehouse

  • Lecția 1 • Navigarea în spațiul de lucru Databricks

    Acoperă interfața utilizator a spațiului de lucru, organizarea resurselor și rolurile utilizatorilor. Cursanții dobândesc familiarizare practică cu mediul înainte de a scrie orice cod.

  • Lecția 2 • Conectarea la surse de date

    Demonstrează montarea stocării în cloud și conectarea la baze de date externe. Stabilește modelele de acces la date necesare pentru toate sarcinile de inginerie a datelor și analiză.

  • Lecția 3 • Ce este arhitectura Lakehouse

    Definește paradigma lakehouse și o contrastează cu depozitele de date și lacurile de date. Stabilește contextul arhitectural pentru toate lucrările ulterioare cu Databricks.

  • Lecția 4 • Lucrul cu notebook-urile Databricks

    Introduce crearea notebook-urilor, comenzile magice și suportul pentru mai multe limbaje. Notebook-urile sunt interfața principală de dezvoltare utilizată în fiecare capitol următor.

  • Lecția 5 • Cluster-e: configurare și gestionare

    Explică tipurile de cluster-e, opțiunile de configurare și gestionarea ciclului de viață. Configurarea corectă a cluster-ului este esențială pentru utilizarea eficientă a resurselor pe parcursul cursului.

Capitolul 2Vezi detalii

Fundamentele Apache Spark în Databricks

  • Lecția 1 • Citirea și scrierea formatelor de date

    Acoperă citirea și scrierea formatelor Parquet, JSON, CSV și Delta cu opțiuni. Gestionarea corectă a formatelor este fundamentală pentru toate pipeline-urile de ingerare și ieșire.

  • Lecția 2 • DataFrames și API-ul DataFrame

    Acoperă crearea DataFrames, inferarea schemei și transformările de bază. DataFrames sunt abstracția principală utilizată în toate capitolele de procesare a datelor.

  • Lecția 3 • Bazele performanței Spark

    Introduce partiționarea, caching-ul și broadcast join-urile pentru reglarea performanței. Aceste tehnici sunt aplicate în capitolele avansate de optimizare ulterioare ale cursului.

  • Lecția 4 • Arhitectura Spark și modelul de execuție

    Explică rolurile driver-ului și executor-ului, DAG-urile și evaluarea leneșă. Înțelegerea fluxului de execuție este esențială pentru scrierea de cod Spark eficient în capitolele următoare.

  • Lecția 5 • Spark SQL pentru interogarea datelor

    Învață interogarea bazată pe SQL deasupra Spark folosind vizualizări temporare și tabele de catalog. Face legătura între competențele SQL și motorul de execuție Spark.

Capitolul 3Vezi detalii

Delta Lake: stocare fiabilă a datelor

  • Lecția 1 • Operații DML pe tabele Delta

    Învață operațiile INSERT, UPDATE, DELETE și MERGE pe tabelele Delta. Permite cursanților să implementeze modele de upsert esențiale pentru pipeline-urile de date incrementale.

  • Lecția 2 • Optimizarea tabelelor Delta

    Acoperă comenzile OPTIMIZE, ZORDER și VACUUM pentru gestionarea performanței și stocării. Aceste operații sunt esențiale pentru menținerea tabelelor Delta de nivel de producție.

  • Lecția 3 • Călătoria în timp și versionarea datelor

    Demonstrează interogarea versiunilor istorice ale tabelelor și restaurarea stărilor anterioare. Călătoria în timp sprijină auditul și recuperarea erorilor în pipeline-urile de date de producție.

  • Lecția 4 • Crearea și gestionarea tabelelor Delta

    Acoperă operațiile DDL, proprietățile tabelelor și tabelele gestionate vs. externe. Aceste competențe sunt necesare pentru construirea straturilor de date structurate în capitolele ulterioare de pipeline.

  • Lecția 5 • Concepte de bază ale Delta Lake

    Explică jurnalul de tranzacții Delta, garanțiile ACID și modul în care Delta diferă de Parquet simplu. Oferă fundația conceptuală pentru toate operațiile cu tabele Delta.

Capitolul 4Vezi detalii

Ingerarea datelor și pipeline-uri ETL

  • Lecția 1 • Auto Loader pentru ingerare incrementală

    Introduce modurile de notificare a fișierelor și de listare a directoarelor ale Auto Loader pentru ingerare scalabilă. Auto Loader este modelul recomandat de Databricks pentru ingerarea continuă pe bază de fișiere.

  • Lecția 2 • Modele de ingerare în lot

    Acoperă strategiile de încărcare completă și incrementală folosind Spark și Delta. Stabilește modelele de ingerare care stau la baza tuturor arhitecturilor de pipeline din acest capitol.

  • Lecția 3 • Construirea logicii de transformare

    Acoperă modelele de transformare în mai mulți pași, inclusiv curățarea, îmbogățirea și deduplicarea. Logica de transformare este stratul de valoare adăugată principal în orice pipeline ETL.

  • Lecția 4 • Delta Live Tables pentru orchestrarea pipeline-urilor

    Introduce Delta Live Tables (DLT) pentru definirea declarativă a pipeline-urilor și impunerea calității. DLT simplifică gestionarea pipeline-urilor și se integrează cu arhitectura medalion.

  • Lecția 5 • Fundamentele Structured Streaming

    Învață streamingul micro-batch și continuu cu Spark Structured Streaming. Oferă fundația de streaming necesară pentru secțiunile viitoare de pipeline în timp real.

Capitolul 5Vezi detalii

Modelarea datelor și arhitectura medalion

  • Lecția 1 • Principii ale arhitecturii medalion

    Definește responsabilitățile straturilor Bronz, Argint și Aur și contractele de date. Oferă cadrul structural aplicat în fiecare secțiune ulterioară de modelare și pipeline.

  • Lecția 2 • Proiectarea stratului Bronz

    Acoperă aterizarea datelor brute, schema-on-read și păstrarea fidelității sursei. Un strat Bronz bine proiectat asigură auditabilitate completă și capacitate de reprocesare.

  • Lecția 3 • Construirea agregatelor stratului Aur

    Acoperă construirea tabelelor pre-agregate, denormalizate, optimizate pentru BI și raportare. Tabelele Aur reduc complexitatea interogărilor și îmbunătățesc performanța tablourilor de bord.

  • Lecția 4 • Construirea stratului Argint

    Învață curățarea, conversia tipurilor, deduplicarea și conformarea datelor la o schemă unificată. Stratul Argint este sursa principală pentru sarcinile de lucru analitice și ML.

  • Lecția 5 • Calitatea datelor și așteptările

    Introduce impunerea constrângerilor, modelele de carantină și urmărirea metricilor de calitate. Încorporarea verificărilor de calitate în fiecare strat împiedică propagarea datelor proaste în aval.

Capitolul 6Vezi detalii

Databricks SQL și analiză

  • Lecția 1 • Optimizarea interogărilor pentru analiză

    Învață analiza planurilor de execuție, strategii de caching și caching al rezultatelor pentru sarcini de lucru SQL. Interogările optimizate reduc costurile depozitelor și îmbunătățesc experiența utilizatorului.

  • Lecția 2 • Construirea tablourilor de bord și a vizualizărilor

    Acoperă crearea de diagrame, tablouri de bord și alerte în cadrul Databricks SQL. Tablourile de bord permit părților interesate de business să consume date fără a scrie cod.

  • Lecția 3 • Unity Catalog pentru guvernanța datelor

    Introduce spațiul de nume pe trei niveluri al Unity Catalog, controlul accesului și proveniența datelor. Guvernanța este fundamentală pentru analiza securizată și conformă între echipe.

  • Lecția 4 • Tehnici SQL avansate în Databricks

    Învață funcții de fereastră, CTE-uri și funcții de ordin superior pentru interogări analitice complexe. Aceste tehnici permit analize sofisticate direct în Databricks SQL.

  • Lecția 5 • Depozite SQL și execuția interogărilor

    Acoperă tipurile de depozite SQL, dimensionarea și rutarea interogărilor. Configurarea corectă a depozitului are un impact direct asupra performanței interogărilor și costurilor pentru sarcinile de lucru analitice.

Capitolul 7Vezi detalii

Machine learning cu Databricks și MLflow

  • Lecția 1 • Registrul de modele MLflow

    Introduce înregistrarea modelelor, tranzițiile între etape și gestionarea versiunilor în Registrul de modele. Registrul oferă guvernanță și trasabilitate pentru modelele de producție.

  • Lecția 2 • Servirea modelelor și inferența în lot

    Acoperă endpoint-urile de servire a modelelor în timp real și inferența în lot cu Spark. Implementarea modelelor în ambele moduri asigură flexibilitate pentru diverse cerințe de business.

  • Lecția 3 • Antrenarea modelelor la scară cu Spark

    Acoperă antrenarea distribuită folosind pandas UDF-uri, Spark ML și Hyperopt pentru reglare. Antrenarea distribuită reduce timpul până la obținerea de informații pe seturi mari de date.

  • Lecția 4 • Urmărirea experimentelor cu MLflow

    Învață înregistrarea parametrilor, metricilor și artefactelor cu MLflow Tracking. Urmărirea sistematică a experimentelor permite reproductibilitatea și selectarea informată a modelelor.

  • Lecția 5 • ML Runtime Databricks și ingineria caracteristicilor

    Acoperă mediul ML Runtime, bibliotecile pre-instalate și elementele de bază ale Feature Store. Un set de caracteristici bine pregătit este fundația antrenării reproductibile a modelelor.

Capitolul 8Vezi detalii

Orchestrarea fluxurilor de lucru și implementarea în producție

  • Lecția 1 • Monitorizare, înregistrare și gestionarea costurilor

    Acoperă jurnalele de evenimente ale cluster-elor, metricile job-urilor, jurnalele de audit și urmărirea costurilor DBU. Observabilitatea și controlul costurilor sunt esențiale pentru operațiunile de producție sustenabile.

  • Lecția 2 • Planificarea și declanșarea fluxurilor de lucru

    Învață planificarea bazată pe cron, declanșatoarele de sosire a fișierelor și declanșatoarele API externe. Declanșarea flexibilă asigură că pipeline-urile rulează la momentul potrivit cu intervenție manuală minimă.

  • Lecția 3 • Infrastructură ca cod cu Terraform

    Introduce furnizarea resurselor Databricks folosind provider-ul Terraform. Infrastructura ca cod asigură configurarea reproductibilă și auditabilă a mediilor în diferite spații de lucru.

  • Lecția 4 • Job-uri Databricks și orchestrarea sarcinilor

    Acoperă crearea job-urilor cu mai multe sarcini, setarea dependențelor și configurarea calculului pentru fiecare sarcină. Job-urile sunt mecanismul principal pentru rularea sarcinilor de lucru de producție conform unei programări.

  • Lecția 5 • CI/CD pentru Databricks cu Repos

    Acoperă integrarea Git prin Databricks Repos, strategii de branch și implementare automatizată. Practicile CI/CD reduc riscul de implementare și accelerează livrarea produselor de date.

Certificare

Certificatul tău valid de finalizare

Acest curs este pentru tine:

  • Inginer de date: pregătit să treacă dincolo de pipeline-urile de bază către o platformă lakehouse unificată.

  • Analist de date: dorește să interogheze și să vizualizeze date la scară folosind Databricks SQL.

  • Om de știință a datelor: are nevoie de o platformă fiabilă pentru ingineria caracteristicilor și deployment-ul modelelor.

  • Inginer de analiză: construiește straturi de transformare de tip dbt și explorează alternative native Spark.

  • Inginer cloud: sprijină echipele de date și are nevoie de cunoștințe mai aprofundate despre infrastructura Databricks.

  • Persoană în reconversie profesională: face tranziția de la dezvoltarea software către ingineria modernă a datelor.

Ce spun cursanții noștri

Lecțiile dumneavoastră sunt perfecte. Am achiziționat pachetul de un an și, în sfârșit, am oportunitatea să urmăresc diverse subiecte de interes fără să fie nevoie să schimb platforma... vă mulțumesc pentru tot ceea ce faceți, v-am recomandat deja altor persoane...
Giulio Carlo
Giulio CarloStudent Marketing Digital
Îmi place cum lecțiile sunt directe la subiect și cum pot să schimb capitolele și să sar peste conținutul de care nu am nevoie.
Mariana Ferres
Mariana FerresStudentă Fotografie
Îmi place conținutul și modul de prezentare și transcriere a videoclipurilor, ceea ce accelerează procesul!
Luciana Alvarenga
Luciana AlvarengaStudentă Design Unghii
Platforma este rapidă, simplă de utilizat. Diversitatea conținutului și videoclipurile complementare ajută foarte mult la învățare.
André Felipe
André FelipeStudent Inginerie Prompt

Cele mai importante formări

Întrebări frecvente

Cine este Dedika?

Este certificatul valabil în România?

Cursurile sunt gratuite?

Care este volumul de muncă al cursului?

Cum sunt cursurile?

Cum funcționează cursurile?

Care este durata cursurilor?

Care este costul sau prețul cursurilor?

Ce este un curs EAD sau online și cum funcționează?

Curs PDF