
Kurs Python dla Inżynierów Danych
Opanuj umiejętności Pythona, których inżynierowie danych używają na co dzień — od budowania potoków ETL i łączenia się z bazami danych po orkiestrację przepływów pracy i wdrażanie kodu gotowego do produkcji. Ten kurs prowadzi Cię od podstaw Pythona do zaawansowanych wzorców inżynierii danych stosowanych na dużą skalę.
Czego się nauczysz:
Nauczysz się pisać skrypty w Pythonie, które pobierają dane z API, plików i baz danych, a następnie przekształcają je i ładują do relacyjnych baz danych, hurtowni danych i magazynów w chmurze. Będziesz pracować z Pandas do manipulacji danymi, SQLAlchemy do łączności z bazami danych i Apache Airflow do orkiestracji potoków. Kurs obejmuje walidację jakości danych, optymalizację wydajności, przetwarzanie równoległe i praktyki CI/CD przy wdrażaniu potoków. Poznasz również PySpark do przetwarzania rozproszonego, Kafka do potoków strumieniowych i najlepsze praktyki bezpieczeństwa w celu ochrony wrażliwych danych w środowiskach produkcyjnych.
Jak uczysz się w praktyce Kurs Python dla Inżynierów Danych
Jak ćwiczysz Kurs Python dla Inżynierów Danych
Dla firm, które chcą szkolić swój zespół
W Dedika dla firm kurs zawiera ćwiczenia i przykłady dostosowane do Twojego biznesu i potrzeb Twojej firmy.
Treść kursu
8 Rozdziały • 37 LekcjeCzas trwania od 4 do 360 godzin (Ty decydujesz)
Rozdział 1UkryjUkryj szczegółyZobacz szczegółyPodstawy Pythona dla inżynierów danych
Podstawy Pythona dla inżynierów danych
Lekcja 1 • Przepływ sterowania i iteracja
Stosuj instrukcje warunkowe, pętle i wyrażenia składane do przetwarzania sekwencji rekordów danych. Bezpośrednio odwzorowuje logikę transformacji na poziomie wierszy stosowaną w potokach ETL.
Lekcja 2 • Funkcje i obsługa błędów
Definiuj funkcje wielokrotnego użytku z argumentami, wartościami domyślnymi i wartościami zwracanymi, a następnie elegancko obsługuj wyjątki. Umożliwia tworzenie modułowego, odpornego na błędy kodu potoku.
Lekcja 3 • Podstawowa składnia Pythona i typy danych
Omówienie zmiennych, operatorów i wbudowanych typów, w tym łańcuchów znaków, liczb całkowitych, zmiennoprzecinkowych i wartości logicznych. Stanowi podstawę składniową do pisania dowolnej logiki potoku danych.
Lekcja 4 • Kolekcje: listy, krotki, słowniki, zbiory
Poznaj typy kolekcji mutowalnych i niemutowalnych oraz związane z nimi kompromisy wydajnościowe. Te struktury stanowią podstawę operacji na danych w pamięci w całym kursie.
Lekcja 5 • Konfiguracja środowiska Python
Zainstaluj Pythona, skonfiguruj środowiska wirtualne i wybierz IDE odpowiednie do pracy z danymi. Ustanawia odtwarzalne środowisko pracy, od którego zależą wszystkie kolejne rozdziały.
Rozdział 2UkryjUkryj szczegółyZobacz szczegółyWe/Wy plików i serializacja danych
We/Wy plików i serializacja danych
Lekcja 1 • Formaty binarne: Parquet i Avro
Odczyt i zapis kolumnowych plików Parquet i wierszowych plików Avro przy użyciu bibliotek Pythona. Te formaty są standardem w nowoczesnych architekturach jezior danych.
Lekcja 2 • Praca z plikami tekstowymi i CSV
Otwieranie, odczyt i zapis plików tekstowych przy użyciu menedżerów kontekstu, a następnie parsowanie CSV za pomocą biblioteki standardowej. Obejmuje najczęstszy format surowych danych w potokach wsadowych.
Lekcja 3 • Operacje na systemie plików i ścieżkach
Nawiguj po katalogach, przeszukuj pliki za pomocą wzorców i zarządzaj ścieżkami przy użyciu modułów pathlib i os. Automatyzuje typowe kroki odnajdywania plików w przepływach pracy pobierania wsadowego.
Lekcja 4 • Formaty danych JSON i XML
Parsowanie i serializacja ładunków JSON oraz nawigacja po drzewach XML do przetwarzania API i plików konfiguracyjnych. Łączy się z rzeczywistym pobieraniem odpowiedzi z API REST.
Rozdział 3UkryjUkryj szczegółyZobacz szczegółyManipulacja danymi za pomocą Pandas
Manipulacja danymi za pomocą Pandas
Lekcja 1 • Podstawy DataFrame i Series
Twórz obiekty DataFrame ze słowników, CSV i JSON, a następnie sprawdzaj strukturę i typy danych. Stanowi podstawę wszystkich prac transformacyjnych opartych na Pandas.
Lekcja 2 • Filtrowanie, sortowanie i wybór
Stosuj maski logiczne, selektory loc/iloc i operacje sortowania, aby wyodrębnić odpowiednie podzbiory danych. Bezpośrednio wspomaga filtrowanie jakości danych na etapach potoku.
Lekcja 3 • Agregacja, grupowanie i przestawianie
Podsumowuj dane za pomocą operacji groupby, agg i pivot, aby uzyskać wyniki analityczne. Umożliwia obliczanie metryk i raportowanie w ramach przepływów pracy potoku.
Lekcja 4 • Czyszczenie danych i wymuszanie typów
Obsługuj brakujące wartości, duplikaty i nieprawidłowe typy, aby uzyskać czyste, spójne zbiory danych. Czyszczenie jest najbardziej czasochłonnym krokiem w rzeczywistych potokach danych.
Lekcja 5 • Łączenie i scalanie DataFrame
Łącz zbiory danych za pomocą merge, join i concat, aby odtworzyć relacyjną logikę w stylu SQL. Niezbędne do denormalizacji danych przed załadowaniem do magazynów analitycznych.
Rozdział 4UkryjUkryj szczegółyZobacz szczegółyŁączność z bazami danych i integracja SQL
Łączność z bazami danych i integracja SQL
Lekcja 1 • Praca z bazami danych NoSQL
Połącz się z magazynami dokumentów i par klucz-wartość, wykonuj operacje CRUD i mapuj wyniki na obiekty Pythona. Rozszerza łączność potoków poza systemy relacyjne.
Lekcja 2 • Relacyjne bazy danych z SQLAlchemy
Nawiąż połączenia, odwzoruj schematy i wykonuj surowy SQL przy użyciu podstawowego API SQLAlchemy. Zapewnia niezależną od bazy danych warstwę dostępu dla kodu potoku.
Lekcja 3 • Poolowanie połączeń i najlepsze praktyki
Skonfiguruj pule połączeń, bezpiecznie zarządzaj poświadczeniami i unikaj typowych antywzorców. Zapewnia niezawodność i bezpieczeństwo na poziomie produkcyjnym w kodzie dostępu do bazy danych.
Lekcja 4 • Zapis i upsert danych
Wstawiaj, aktualizuj i wykonuj upsert rekordów programowo za pomocą SQLAlchemy i Pandas to_sql. Obejmuje ścieżkę zapisu wymaganą do ładowania wyników potoku do baz danych.
Rozdział 5UkryjUkryj szczegółyZobacz szczegółyBudowanie potoków ETL w Pythonie
Budowanie potoków ETL w Pythonie
Lekcja 1 • Rejestrowanie i obserwowalność potoku
Instrumentuj potoki za pomocą ustrukturyzowanego logowania, metryk i alertów, aby umożliwić monitorowanie operacyjne. Przekształca skrypty w obserwowalne, gotowe do produkcji procesy.
Lekcja 2 • Logika transformacji i reguły biznesowe
Zaimplementuj mapowania pól, kolumny pochodne i reguły walidacji jako czyste funkcje Pythona. Hermetyzuje logikę biznesową w testowalnych, wielokrotnego użytku jednostkach transformacji.
Lekcja 3 • Ładowanie danych do systemów docelowych
Zapisuj przekształcone dane do baz danych, hurtowni danych i magazynów obiektów za pomocą łączników Pythona. Kończy potok, dostarczając czyste dane do miejsca przeznaczenia.
Lekcja 4 • Architektura ETL i wzorce projektowe
Zrozum etapy potoku, przepływ danych i typowe wzorce projektowe, takie jak ELT i architektura medalionowa. Stanowi ramy koncepcyjne dla wszystkich prac związanych z implementacją potoku.
Lekcja 5 • Ekstrakcja danych z API
Pobieraj dane z API REST za pomocą biblioteki requests, obsługuj paginację i zarządzaj limitami szybkości. Obejmuje najczęstsze nowoczesne źródło danych dla potoków pobierania.
Rozdział 6UkryjUkryj szczegółyZobacz szczegółyPraca z magazynem i usługami w chmurze
Praca z magazynem i usługami w chmurze
Lekcja 1 • Infrastruktura jako kod dla potoków danych
Definiuj zasoby chmurowe programowo za pomocą narzędzi IaC opartych na Pythonie, aby zautomatyzować konfigurację środowiska. Redukuje ręczne przygotowanie i zapewnia odtwarzalną infrastrukturę potoku.
Lekcja 2 • Pobieranie sterowane zdarzeniami za pomocą kolejek komunikatów
Produkuj i konsumuj komunikaty z kolejek i tematów strumieniowych, aby wyzwalać wykonanie potoku. Łączy potoki Pythona z architekturami danych sterowanymi zdarzeniami i czasu rzeczywistego.
Lekcja 3 • Współdziałanie z zarządzanymi hurtowniami danych
Połącz się z chmurowymi hurtowniami danych za pomocą łączników Pythona, wykonuj zapytania i ładuj dane wydajnie. Umożliwia potokom Pythona obsługę obciążeń analitycznych na dużą skalę.
Lekcja 4 • Magazyn obiektów w chmurze z zestawami SDK Pythona
Przesyłaj, pobieraj, listuj i usuwaj obiekty w zasobnikach magazynu chmurowego za pomocą zestawów SDK dostawców. Magazyn obiektów jest główną strefą docelową dla surowych danych w potokach chmurowych.
Rozdział 7UkryjUkryj szczegółyZobacz szczegółyOrkiestracja i harmonogramowanie potoków
Orkiestracja i harmonogramowanie potoków
Lekcja 1 • Obsługa błędów i strategie ponawiania
Skonfiguruj ponawianie, limity czasu i alerty SLA, aby orkiestrowane potoki były odporne na przejściowe awarie. Bezpośrednio redukuje ręczną interwencję w środowiskach produkcyjnych.
Lekcja 2 • Dynamiczne DAG-i i parametryzacja
Generuj DAG-i programowo i przekazuj parametry czasu wykonania do zadań, aby uzyskać elastyczne wykonanie potoku. Umożliwia skalowalną orkiestrację wielu podobnych wariantów potoku.
Lekcja 3 • Koncepcje orkiestracji i krajobraz narzędzi
Zrozum DAG-i, zależności zadań i rolę orkiestratorów w inżynierii danych. Stanowi koncepcyjną podstawę przed implementacją kodu orkiestracji.
Lekcja 4 • Budowanie DAG-ów za pomocą Apache Airflow
Definiuj DAG-i, operatory i zależności zadań w Airflow za pomocą Pythona, aby planować uruchomienia potoku. Airflow jest najczęściej wdrażanym orkiestratorem w inżynierii danych.
Lekcja 5 • Monitorowanie i alerty w orkiestracji
Używaj interfejsów UI orkiestratora, logów i zewnętrznych integracji alertów do śledzenia kondycji potoku. Zamyka pętlę obserwowalności dla kompleksowych operacji potoku.
Rozdział 8UkryjUkryj szczegółyZobacz szczegółyWydajność, testowanie i gotowość produkcyjna
Wydajność, testowanie i gotowość produkcyjna
Lekcja 1 • Jakość kodu i pakowanie
Wymuszaj styl za pomocą linterów, sprawdzaj typy za pomocą mypy i pakuj kod potoku jako instalowalne moduły Pythona. Podnosi łatwość utrzymania kodu do standardów profesjonalnej inżynierii oprogramowania.
Lekcja 2 • Testy jednostkowe i integracyjne dla potoków
Pisz testy jednostkowe oparte na pytest dla funkcji transformacji i testy integracyjne dla interakcji z bazami danych. Testowanie zapobiega regresjom i weryfikuje poprawność potoku.
Lekcja 3 • Przetwarzanie równoległe i współbieżne
Stosuj wzorce wieloprocesowości, wielowątkowości i asynchroniczności do parallelizacji zadań związanych z we/wy i obciążających procesor. Znacznie skraca całkowity czas wykonania potoku.
Lekcja 4 • Profilowanie i optymalizacja kodu Pythona
Zidentyfikuj wąskie gardła za pomocą narzędzi do profilowania i zastosuj wektoryzację, przetwarzanie fragmentami i buforowanie w celu poprawy przepustowości. Optymalizacja wydajności jest kluczowa dla potoków danych na dużą skalę.
Lekcja 5 • CI/CD do wdrażania potoków danych
Automatyzuj testowanie, linting i wdrażanie kodu potoku za pomocą potoków CI/CD wyzwalanych przez zdarzenia kontroli wersji. Umożliwia bezpieczne, powtarzalne wydania produkcyjne.
Twój ważny certyfikat ukończenia
Ten kurs jest dla Ciebie:
Młodszy analityk danych: gotowy do automatyzacji powtarzalnych procesów danych za pomocą Pythona.
Deweloper SQL: chcący rozszerzyć umiejętności o programistyczną budowę potoków.
Deweloper oprogramowania: zmiana ścieżki kariery w kierunku inżynierii danych z ogólnego programistycznego doświadczenia.
Inżynier business intelligence: poszukuje pełnej własności potoku danych od początku do końca.
Absolwent kierunku informatycznego: szuka praktycznego, gotowego do pracy doświadczenia w inżynierii danych.
Samouk programowania: pasjonat danych z zamiarem objęcia stanowiska inżyniera.
Co mówią nasi uczniowie
Wasze lekcje są doskonałe. Kupiłem pakiet roczny i w końcu mam możliwość śledzenia różnych tematów, które mnie interesują, bez konieczności zmiany platformy... dziękuję za wszystko, co robicie, już polecałem was innym osobom...

Podoba mi się, jak lekcje są konkretne i jak mogę przełączać rozdziały i pomijać treści, których nie potrzebuję.

Podoba mi się treść i sposób prezentacji oraz transkrypcja filmów, co przyspiesza proces!

Platforma jest szybka, prosta w użyciu. Różnorodność treści i filmy uzupełniające bardzo pomagają w nauce.

Najważniejsze szkolenia
FAQ
Kim jest Dedika?
Czy certyfikat jest ważny w Polska?
Czy kursy są darmowe?
Jaki jest wymiar godzinowy kursu?
Jak wyglądają kursy?
Jak działają kursy?
Jaki jest czas trwania kursów?
Jaki jest koszt lub cena kursów?
Czym jest kurs EAD lub kurs online i jak działa?
Kurs PDF




















