Piliin ang iyong wika
Python Data Engineering Course
Mahigit 2 milyong mag-aaral sa buong mundo ang gumagamit nito

Python Data Engineering Course

Maging dalubhasa sa mga kasanayan sa Python na ginagamit ng mga data engineer araw-araw — mula sa pagbuo ng mga ETL pipeline at pagkonekta sa mga database hanggang sa pag-orkestrate ng mga workflow at pag-deploy ng production-ready code. Dadalhin kayo ng kursong ito mula sa mga pangunahing kaalaman sa Python hanggang sa mga advanced na pattern ng data engineering na ginagamit sa malakihang operasyon.

Dedika para sa mga negosyo

Ano ang iyong matututuhan:

Matututunan ninyong magsulat ng mga Python script na kumukuha ng data mula sa mga API, file, at database, at pagkatapos ay i-transform at i-load ito sa mga relational database, data warehouse, at cloud storage. Makikipagtrabaho kayo sa Pandas para sa data manipulation, SQLAlchemy para sa database connectivity, at Apache Airflow para sa pipeline orchestration. Sinasaklaw ng kurso ang data quality validation, performance optimization, parallel processing, at mga gawi sa CI/CD para sa pipeline deployment. Ie-explore din ninyo ang PySpark para sa distributed processing, Kafka para sa mga streaming pipeline, at mga security best practice para sa pagprotekta ng sensitibong data sa mga production environment.

Paano ka mag-aaral nang praktikal Python Data Engineering Course

Paano ka magsasanay Python Data Engineering Course

Para sa mga negosyo na gustong sanayin ang kanilang team

Sa Dedika para sa mga negosyo, ang kurso ay may mga ehersisyo at halimbawa na akma sa iyong negosyo at ayon sa pangangailangan ng iyong kumpanya.

I-click dito

Nilalaman ng kurso

8 Kabanata • 37 Mga AralinTagal mula 4 hanggang 360 oras (ikaw ang magpapasya)

Kabanata 1Tingnan ang mga detalye

Mga Pundasyon ng Python para sa mga Data Engineer

  • Aralin 1 • Control Flow at Iteration

    Ilapat ang mga conditional, loop, at comprehension upang iproseso ang mga sequence ng data record. Direktang tumutugma sa lohika ng row-level transformation na ginagamit sa mga ETL pipeline.

  • Aralin 2 • Mga Function at Error Handling

    Tukuyin ang mga reusable na function na may mga argument, default, at return value, pagkatapos ay i-handle ang mga exception nang maayos. Nagbibigay-daan sa modular at fault-tolerant na pipeline code.

  • Aralin 3 • Pangunahing Python Syntax at Mga Uri ng Datos

    Saklawin ang mga variable, operator, at built-in na uri kabilang ang mga string, integer, float, at boolean. Nagbibigay ng syntactic baseline para sa pagsulat ng anumang lohika ng data pipeline.

  • Aralin 4 • Mga Koleksyon: Listahan, Tuple, Diksyunaryo, Set

    Galugarin ang mga mutable at immutable na uri ng koleksyon at ang kanilang mga trade-off sa performance. Ang mga istrukturang ito ay sumusuporta sa in-memory data manipulation sa buong kurso.

  • Aralin 5 • Pag-set Up ng Python Environment

    I-install ang Python, i-configure ang mga virtual environment, at pumili ng IDE na angkop para sa data work. Itinatatag ang reproducible workspace na nakasalalay sa lahat ng susunod na kabanata.

Kabanata 2Tingnan ang mga detalye

File I/O at Data Serialization

  • Aralin 1 • Mga Binary Format: Parquet at Avro

    Basahin at isulat ang columnar na Parquet at row-based na Avro file gamit ang mga library ng Python. Ang mga format na ito ay pamantayan sa mga modernong arkitektura ng data lake.

  • Aralin 2 • Paggawa sa Text at CSV Files

    Buksan, basahin, at isulat ang mga text file gamit ang mga context manager, pagkatapos ay i-parse ang CSV gamit ang standard library. Sinasaklaw ang pinakakaraniwang raw data format sa mga batch pipeline.

  • Aralin 3 • File System at Path Operations

    Mag-navigate sa mga directory, mag-glob ng mga file, at pamahalaan ang mga path gamit ang mga modyul na pathlib at os. Ino-automate ang mga hakbang sa pagtuklas ng file na karaniwan sa mga batch ingestion workflow.

  • Aralin 4 • JSON at XML Data Formats

    I-parse at i-serialize ang mga JSON payload at i-navigate ang mga XML tree para sa API at pagpoproseso ng config file. Kumokonekta sa real-world na pag-ingest ng mga REST API response.

Kabanata 3Tingnan ang mga detalye

Pagmamanipula ng Datos gamit ang Pandas

  • Aralin 1 • Mga Pundamental ng DataFrames at Series

    Lumikha ng mga DataFrame mula sa mga dict, CSV, at JSON, pagkatapos ay siyasatin ang istruktura at mga uri ng datos. Binubuo ang pundasyon para sa lahat ng gawaing pag-transform na nakabatay sa Pandas.

  • Aralin 2 • Pag-filter, Pagso-sort, at Pagpili

    Ilapat ang mga boolean mask, loc/iloc selector, at sort operations upang ihiwalay ang mga nauugnay na subset ng datos. Direktang sumusuporta sa data quality filtering sa mga yugto ng pipeline.

  • Aralin 3 • Aggregation, Grouping, at Pivoting

    Ibuod ang datos gamit ang groupby, agg, at pivot operations upang makagawa ng mga analytical output. Nagbibigay-daan sa metric computation at pag-uulat sa loob ng mga pipeline workflow.

  • Aralin 4 • Paglilinis ng Datos at Type Coercion

    I-handle ang mga nawawalang value, duplicate, at maling uri upang makagawa ng malinis at pare-parehong mga dataset. Ang paglilinis ang pinakamatagal na hakbang sa mga real-world data pipeline.

  • Aralin 5 • Pag-merge at Pag-join ng mga DataFrame

    Pagsamahin ang mga dataset gamit ang merge, join, at concat upang gayahin ang SQL-style relational logic. Mahalaga para sa pagde-denormalize ng datos bago i-load sa mga analytical store.

Kabanata 4Tingnan ang mga detalye

Database Connectivity at SQL Integration

  • Aralin 1 • Paggawa sa mga NoSQL Database

    Kumonekta sa mga document at key-value store, magsagawa ng mga CRUD operation, at i-map ang mga resulta sa mga Python object. Pinapalawak ang pipeline connectivity lampas sa mga relational system.

  • Aralin 2 • Mga Relational Database gamit ang SQLAlchemy

    Magtatag ng mga koneksyon, i-reflect ang mga schema, at magsagawa ng raw SQL gamit ang core API ng SQLAlchemy. Nagbibigay ng database-agnostic access layer para sa pipeline code.

  • Aralin 3 • Connection Pooling at Pinakamahuhusay na Gawi

    I-configure ang mga connection pool, pamahalaan nang ligtas ang mga kredensyal, at iwasan ang mga karaniwang anti-pattern. Tinitiyak ang production-grade na pagiging maaasahan at seguridad sa database access code.

  • Aralin 4 • Pagsusulat at Pag-upsert ng Datos

    Mag-insert, mag-update, at mag-upsert ng mga record nang programmatically gamit ang SQLAlchemy at Pandas to_sql. Sinasaklaw ang write path na kinakailangan para sa pag-load ng mga pipeline output sa mga database.

Kabanata 5Tingnan ang mga detalye

Pagbuo ng mga ETL Pipeline sa Python

  • Aralin 1 • Pipeline Logging at Observability

    I-instrumento ang mga pipeline gamit ang structured logging, metrics, at alerting upang paganahin ang operational monitoring. Binabago ang mga script sa mga observable at production-ready na proseso.

  • Aralin 2 • Transformation Logic at Business Rules

    Ipatupad ang mga field mapping, derived column, at validation rule bilang mga purong Python function. I-encapsulate ang business logic sa mga testable at reusable na yunit ng transformation.

  • Aralin 3 • Pag-load ng Datos sa Mga Target System

    Isulat ang na-transform na datos sa mga database, data warehouse, at object storage gamit ang mga Python connector. Kinukumpleto ang pipeline sa pamamagitan ng paghahatid ng malinis na datos sa destinasyon nito.

  • Aralin 4 • Arkitektura ng ETL at Mga Design Pattern

    Unawain ang mga yugto ng pipeline, daloy ng datos, at mga karaniwang design pattern tulad ng ELT at medallion architecture. Itinatakda ang konseptwal na framework para sa lahat ng gawaing pag-implement ng pipeline.

  • Aralin 5 • Pag-extract ng Datos mula sa Mga API

    Kumuha ng datos mula sa mga REST API gamit ang library na requests, i-handle ang pagination, at pamahalaan ang mga rate limit. Sinasaklaw ang pinakakaraniwang modernong data source para sa mga ingestion pipeline.

Kabanata 6Tingnan ang mga detalye

Paggawa sa Cloud Storage at Mga Serbisyo

  • Aralin 1 • Infrastructure as Code para sa Mga Data Pipeline

    Tukuyin ang mga mapagkukunan ng cloud nang programmatically gamit ang mga tool na IaC na nakabatay sa Python upang i-automate ang environment setup. Binabawasan ang manu-manong provisioning at tinitiyak ang reproducible pipeline infrastructure.

  • Aralin 2 • Pag-ingest na Batay sa Event gamit ang Message Queue

    Gumawa at tumanggap ng mga mensahe mula sa mga queue at streaming topic upang ma-trigger ang pagsasagawa ng pipeline. Ikinokonekta ang mga Python pipeline sa mga arkitekturang event-driven at real-time na datos.

  • Aralin 3 • Pakikipag-ugnayan sa Managed Data Warehouse

    Kumonekta sa mga cloud data warehouse sa pamamagitan ng mga Python connector, magsagawa ng mga query, at mag-load ng datos nang mahusay. Pinapagana ang mga Python pipeline upang maghatid ng mga analytical workload sa malaking sukat.

  • Aralin 4 • Cloud Object Storage gamit ang mga Python SDK

    Mag-upload, mag-download, maglista, at magtanggal ng mga object sa cloud storage bucket gamit ang mga provider SDK. Ang object storage ang pangunahing landing zone para sa raw data sa mga cloud pipeline.

Kabanata 7Tingnan ang mga detalye

Orchestration at Pag-iiskedyul ng Pipeline

  • Aralin 1 • Error Handling at Mga Estratehiya sa Pag-retry

    I-configure ang mga retry, timeout, at SLA alert upang gawing matatag ang mga naka-orkestratang pipeline laban sa lumilipas na mga pagkabigo. Direktang binabawasan ang manu-manong interbensyon sa mga production environment.

  • Aralin 2 • Dynamic DAGs at Parameterization

    Bumuo ng mga DAG nang programmatically at ipasa ang mga runtime parameter sa mga gawain para sa flexible na pagsasagawa ng pipeline. Nagbibigay-daan sa scalable na orkestrasyon ng maraming katulad na variant ng pipeline.

  • Aralin 3 • Mga Konsepto ng Orchestration at Landscape ng Tool

    Unawain ang mga DAG, dependency ng gawain, at ang papel ng mga orchestrator sa data engineering. Nagbibigay ng konseptwal na pundasyon bago mag-implement ng orchestration code.

  • Aralin 4 • Pagbuo ng mga DAG gamit ang Apache Airflow

    Tukuyin ang mga DAG, operator, at dependency ng gawain sa Airflow gamit ang Python upang i-schedule ang mga pipeline run. Ang Airflow ang pinakamalawak na ginagamit na orchestrator sa data engineering.

  • Aralin 5 • Monitoring at Alerting sa Orchestration

    Gamitin ang mga UI ng orchestrator, mga log, at mga panlabas na alerting integration upang subaybayan ang kalusugan ng pipeline. Isinasara ang observability loop para sa end-to-end na operasyon ng pipeline.

Kabanata 8Tingnan ang mga detalye

Performance, Testing, at Production Readiness

  • Aralin 1 • Kalidad ng Code at Packaging

    Ipatupad ang istilo gamit ang mga linter, i-type-check gamit ang mypy, at i-package ang pipeline code bilang mga installable na Python module. Itinataas ang maintainability ng code sa mga pamantayan ng propesyonal na software engineering.

  • Aralin 2 • Unit at Integration Testing para sa Mga Pipeline

    Sumulat ng mga unit test na nakabatay sa pytest para sa mga transformation function at mga integration test para sa mga interaksyon sa database. Pinipigilan ng testing ang mga regression at pinapatunayan ang kawastuhan ng pipeline.

  • Aralin 3 • Parallel at Concurrent Processing

    Ilapat ang multiprocessing, threading, at async pattern upang i-parallelize ang mga gawain ng pipeline na I/O-bound at CPU-bound. Makabuluhang binabawasan ang end-to-end na runtime ng pipeline.

  • Aralin 4 • Pag-profile at Pag-optimize ng Python Code

    Tukuyin ang mga bottleneck gamit ang mga tool sa pag-profile at ilapat ang vectorization, chunking, at caching upang mapabuti ang throughput. Ang pag-optimize ng performance ay kritikal para sa malalaking data pipeline.

  • Aralin 5 • CI/CD para sa Deployment ng Data Pipeline

    I-automate ang testing, linting, at deployment ng pipeline code gamit ang CI/CD pipeline na na-trigger ng mga kaganapan sa version control. Nagbibigay-daan sa ligtas at nauulit na production release.

Sertipikasyon

Ang iyong wastong sertipiko ng pagtatapos

Ang kursong ito ay para sa iyo:

  • Junior data analyst: handang i-automate ang mga paulit-ulit na workflow ng data gamit ang Python.

  • SQL developer: gustong palawakin ang kasanayan sa programmatic pipeline construction.

  • Software developer: lumilipat sa data engineering mula sa isang pangkalahatang programming background.

  • Business intelligence engineer: naghahanap ng pangangasiwa sa buong data pipeline mula simula hanggang katapusan.

  • Bagong gradwado ng computer science: naghahanap ng praktikal na karanasan sa data engineering na handa sa trabaho.

  • Self-taught programmer: masigasig sa datos at naglalayon ng posisyong pang-inhinyero.

Ano ang sinasabi ng aming mga mag-aaral

Ang mga klase nila ay perpekto. Nakuha ko ang one-year package at sa wakas, may pagkakataon na akong sundan ang iba't ibang mga paksa na interesado ako nang hindi na kailangan lumipat ng platform... salamat sa lahat ng ginagawa ninyo, inirekomenda ko na kayo sa ibang mga tao...
Giulio Carlo
Giulio CarloEstudyante ng Digital Marketing
Gusto ko kung paano direkta sa punto ang mga aralin at kung paano ko mababago ang mga kabanata at malaktawan ang mga content na hindi ko kailangan.
Mariana Ferres
Mariana FerresEstudyante ng Photography
Gusto ko ang content at ang paraan ng pagpresenta at transcription ng mga video, na nagpapabilis sa proseso!
Luciana Alvarenga
Luciana AlvarengaEstudyante ng Nail Design
Ang platform ay mabilis, simple gamitin. Ang diversity ng content at ang mga supplementary videos ay nakakatulong talaga sa pag-aaral.
André Felipe
André FelipeEstudyante ng Prompt Engineering

Pangunahing pagsasanay

FAQ

Sino ang Dedika?

Balido ba ang sertipiko sa Pilipinas?

Libre ba ang mga kurso?

Ano ang workload ng kurso?

Ano ang itsura ng mga kurso?

Paano gumagana ang mga kurso?

Gaano katagal ang mga kurso?

Magkano ang halaga ng mga kurso?

Ano ang EAD o online course at paano ito gumagana?

PDF Course