
Databricks ML Praxis-Kurs
Meistern Sie End-to-End-Machine-Learning auf der Databricks Lakehouse Platform – von der Datenaufnahme und dem Feature Engineering über verteiltes Training, Model Serving bis hin zu produktivem MLOps. Dieser praxisorientierte Kurs stattet Data Scientists und ML-Ingenieure mit den Werkzeugen, Workflows und Governance-Praktiken aus, die echte Enterprise-KI-Systeme antreiben.
Was Sie lernen werden:
Konfigurieren Sie Databricks-Cluster, Speicherintegrationen und Unity Catalog für sichere ML-Workflows.
Erstellen Sie skalierbare Delta-Lake-Pipelines, die bereinigte, versionierte Daten für das Modelltraining liefern.
Entwerfen und verwalten Sie wiederverwendbare Feature-Tabellen mit dem Databricks Feature Store, um Trainings-Serving-Abweichungen zu vermeiden.
Verfolgen, registrieren und überführen Sie Modelle durch einen geregelten MLflow-Lebenszyklus vom Experiment bis zur Produktion.
Stellen Sie Echtzeit- und Batch-Inferenz-Endpunkte mit benutzerdefinierter PyFunc-Logik und automatisiertem Monitoring bereit.
Implementieren Sie CI/CD-Pipelines, Drift-Erkennung und automatisiertes Neutraining, um produktive ML-Systeme zuverlässig zu betreiben.
Wie Sie praxisnah lernen Databricks ML Praxis-Kurs
Wie Sie üben Databricks ML Praxis-Kurs
Für Unternehmen, die ihr Team schulen möchten
Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.
Kursinhalt
8 Kapitel • 40 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)
Kapitel 1AusblendenDetails ausblendenDetails anzeigenDatabricks-Plattformgrundlagen
Databricks-Plattformgrundlagen
Lektion 1 • Notebooks und kollaborative Entwicklung
Führt in die Notebook-Erstellung, Magic Commands und Funktionen für die gemeinsame Bearbeitung ein. Etabliert reproduzierbare Entwicklungspraktiken, die in allen späteren ML-Experimenten verwendet werden.
Lektion 2 • Arbeitsbereichsarchitektur und Navigation
Behandelt die Databricks-Steuerungsebene, die Datenebene und die Benutzeroberfläche des Arbeitsbereichs. Verankert die Teilnehmer in der Umgebung, die sie in jedem folgenden Kapitel nutzen werden.
Lektion 3 • Datenzugriff und Speicherintegration
Erläutert Mount Points, Unity Catalog und die Verwaltung von Anmeldeinformationen für Cloud-Speicher. Ermöglicht den sicheren, konsistenten Datenzugriff, der für ML-Pipelines erforderlich ist.
Lektion 4 • Databricks CLI und REST API-Grundlagen
Führt die programmatische Arbeitsbereichssteuerung über CLI und REST-Endpunkte ein. Bereitet die Teilnehmer darauf vor, Aufgaben zu automatisieren und Databricks in externe Toolchains zu integrieren.
Lektion 5 • Cluster-Konfiguration und -Verwaltung
Vermittelt Clustertypen, Laufzeitversionen und Richtlinien zur automatischen Skalierung. Die Teilnehmer konfigurieren Job- und interaktive Cluster, die für ML-Workloads geeignet sind.
Kapitel 2AusblendenDetails ausblendenDetails anzeigenData Engineering für ML-Pipelines
Data Engineering für ML-Pipelines
Lektion 1 • Delta Live Tables für Pipeline-Orchestrierung
Führt deklarative Pipeline-Definitionen, Erwartungen und die Nachverfolgung der Abstammung ein. Automatisiert die mehrstufige Durchsetzung der Datenqualität, bevor Features das Modelltraining erreichen.
Lektion 2 • Datentransformation mit Spark SQL
Behandelt Aggregationen, Fensterfunktionen und die Handhabung komplexer Typen in Spark SQL. Transformiert Rohdaten in strukturierte Features, die von ML-Modellen genutzt werden.
Lektion 3 • Apache Spark-Grundkonzepte
Behandelt RDDs, DataFrames und das Spark-Ausführungsmodell. Bietet die rechnerische Grundlage für alle Datenverarbeitungsaufgaben in späteren ML-Kapiteln.
Lektion 4 • Delta Lake für ML-Workloads
Führt ACID-Transaktionen, Zeitreisen und Delta-Tabellenoptimierung ein. Sorgt für Datenzuverlässigkeit und Reproduzierbarkeit bei iterativen ML-Experimenten.
Lektion 5 • Datenerfassungsmuster
Lehrt Batch- und Streaming-Erfassung aus Dateien, Datenbanken und Ereignisströmen. Die Teilnehmer erstellen zuverlässige Source-to-Landing-Zone-Pipelines für die ML-Feature-Erstellung.
Kapitel 3AusblendenDetails ausblendenDetails anzeigenFeature Engineering und der Feature Store
Feature Engineering und der Feature Store
Lektion 1 • Beseitigung von Training-Serving-Skew
Behandelt die Konsistenz zwischen Offline-Trainingsdaten und Online-Serving-Features. Die Teilnehmer implementieren lookup-basierte Trainingssets, die Produktionsinferenzpfade widerspiegeln.
Lektion 2 • Databricks Feature Store-Architektur
Erläutert Feature Store-Tabellen, Metadaten und die Offline-Online-Aufteilung. Die Teilnehmer verstehen, wie Features gespeichert, versioniert und für Training und Serving abgerufen werden.
Lektion 3 • Schreiben und Lesen von Feature-Tabellen
Lehrt die Schreib- und Lese-APIs für Batch- und Streaming-Feature-Aktualisierungen. Verbindet Erfassungspipelines aus Kapitel 2 mit nachgelagerten Modelltrainings-Workflows.
Lektion 4 • Feature Engineering-Grundlagen
Behandelt Kodierung, Skalierung, Imputation und Interaktionsterme mit Spark. Etabliert das Feature-Vokabular, das in den Kapiteln zum Feature Store und Modelltraining angewendet wird.
Lektion 5 • Feature-Governance und -Wiederverwendung
Behandelt Feature-Erkennung, Zugriffskontrolle und teamübergreifende Freigabe über Unity Catalog. Reduziert doppelten Engineering-Aufwand und setzt die Datenherkunft über ML-Projekte hinweg durch.
Kapitel 4AusblendenDetails ausblendenDetails anzeigenModelltraining mit MLflow
Modelltraining mit MLflow
Lektion 1 • Training von Deep-Learning-Modellen
Führt TensorFlow- und PyTorch-Trainingsschleifen ein, die in die MLflow-Protokollierung integriert sind. Bereitet die Teilnehmer auf das verteilte Deep Learning vor, das im Kapitel für fortgeschrittenes Training behandelt wird.
Lektion 2 • Hyperparameter-Tuning mit Hyperopt
Lehrt Bayes'sche Optimierung und parallele Suche mit Hyperopt und SparkTrials. Die Teilnehmer verbessern die Modellleistung systematisch über die manuelle Rastersuche hinaus.
Lektion 3 • MLflow Tracking-Grundlagen
Führt Experimente, Durchläufe, Parameter, Metriken und Tags in MLflow ein. Etabliert die Protokollierungsdisziplin, die dem reproduzierbaren ML während des gesamten Kurses zugrunde liegt.
Lektion 4 • Training von Scikit-learn- und Spark ML-Modellen
Behandelt Pipeline-Konstruktion, Kreuzvalidierung und MLflow-Autologging für beide Frameworks. Die Teilnehmer trainieren und protokollieren Basismodelle, die als Benchmarks für fortgeschrittene Techniken dienen.
Lektion 5 • MLflow-Projekte und Reproduzierbarkeit
Behandelt MLflow-Projekte, Einstiegspunkte und Umgebungsspezifikationen für portables Training. Ermöglicht Teams, jeden Experimentdurchlauf auf jedem kompatiblen Cluster zu reproduzieren.
Kapitel 5AusblendenDetails ausblendenDetails anzeigenModellregistrierung und Lebenszyklusmanagement
Modellregistrierung und Lebenszyklusmanagement
Lektion 1 • Registrieren und Versionieren von Modellen
Lehrt die programmatische und UI-basierte Modellregistrierung aus MLflow-Durchläufen. Die Teilnehmer etablieren eine konsistente Versionierungsdisziplin für alle trainierten Modelle.
Lektion 2 • Phasenübergänge und Genehmigungs-Workflows
Behandelt Übergänge in Staging, Produktion und Archivierung mit Webhook-basierten Benachrichtigungen. Implementiert einen kontrollierten Freigabeprozess, der den Unternehmens-MLOps-Standards entspricht.
Lektion 3 • Unity Catalog Model Registry
Erläutert die Unity Catalog-gestützte Model Registry für die arbeitsbereichsübergreifende Governance. Die Teilnehmer migrieren von der Modellverwaltung auf Arbeitsbereichsebene zur Katalogebene für Unternehmensskalierung.
Lektion 4 • Modellsignaturen und Eingabebeispiele
Führt MLflow-Modellsignaturen, Eingabebeispiele und Schema-Durchsetzung ein. Verhindert Laufzeittypfehler und dokumentiert erwartete Modellschnittstellen für nachgelagerte Nutzer.
Lektion 5 • MLflow Model Registry-Überblick
Erläutert registrierte Modelle, Versionen, Phasen und Aliase in der Model Registry. Verbindet Experimentdurchläufe aus Kapitel 4 mit einer gesteuerten Freigabe-Pipeline.
Kapitel 6AusblendenDetails ausblendenDetails anzeigenSkalierbares und verteiltes Modelltraining
Skalierbares und verteiltes Modelltraining
Lektion 1 • Verteiltes Hyperparameter-Tuning in großem Maßstab
Erweitert Hyperopt SparkTrials und führt Optuna für die groß angelegte parallele Suche ein. Die Teilnehmer optimieren Deep-Learning-Modelle effizient über Hunderte gleichzeitiger Versuche.
Lektion 2 • TorchDistributor für PyTorch-Training
Führt TorchDistributor als native Databricks-API für verteiltes PyTorch ein. Die Teilnehmer starten Multi-GPU- und Multi-Node-PyTorch-Jobs ohne manuelle Cluster-Konfiguration.
Lektion 3 • Konzepte für verteiltes Training
Behandelt Datenparallelität, Modellparallelität und Gradienten-Synchronisationsstrategien. Bietet die notwendige theoretische Grundlage vor der Implementierung verteilter Frameworks.
Lektion 4 • Horovod für verteiltes Deep Learning
Lehrt Horovod-Initialisierung, rangbasiertes Data Sharding und HorovodRunner auf Databricks. Die Teilnehmer konvertieren Einzelknoten-Trainingsskripte in verteilte Multi-Node-Jobs.
Lektion 5 • Pandas-UDFs für verteilte Inferenz
Behandelt skalare, gruppierte Map- und Iterator-Pandas-UDFs zur Anwendung von Modellen in Spark-Maßstab. Ermöglicht Batch-Inferenz auf Milliarden von Zeilen, ohne Daten vom Cluster zu verschieben.
Kapitel 7AusblendenDetails ausblendenDetails anzeigenModell-Deployment und Echtzeit-Serving
Modell-Deployment und Echtzeit-Serving
Lektion 1 • Databricks Model Serving-Architektur
Erläutert serverloses Model Serving, Endpunkttypen und Traffic-Routing. Orientiert die Teilnehmer an der Serving-Schicht, bevor Live-Endpunkte konfiguriert und getestet werden.
Lektion 2 • Externe Deployment-Ziele
Behandelt den Export von Modellen in ONNX, Docker-Container und Cloud-native Serving-Plattformen. Bereitet die Teilnehmer darauf vor, mit Databricks trainierte Modelle außerhalb der Databricks-Umgebung bereitzustellen.
Lektion 3 • Benutzerdefinierte Inferenzlogik mit PyFunc
Lehrt den MLflow-PyFunc-Flavor zum Verpacken beliebiger Python-Logik als deploybares Modell. Die Teilnehmer fügen Serving-Endpunkten Vorverarbeitungs-, Nachverarbeitungs- und Ensemble-Logik hinzu.
Lektion 4 • Bereitstellen von MLflow-Modellen auf Endpunkten
Behandelt Endpunkterstellung, Modellversions-Pinning und REST API-Aufrufe. Die Teilnehmer stellen registrierte Modelle aus Kapitel 5 bereit und validieren die Antworten vollständig.
Lektion 5 • Batch-Inferenz-Pipelines
Implementiert geplantes Batch-Scoring mit Databricks Jobs und mlflow.pyfunc.spark_udf. Ergänzt das Echtzeit-Serving für Anwendungsfälle mit hohem Durchsatz und Latenztoleranz.
Kapitel 8AusblendenDetails ausblendenDetails anzeigenMLOps, Überwachung und Produktions-Governance
MLOps, Überwachung und Produktions-Governance
Lektion 1 • Audit, Abstammung und Compliance
Behandelt Unity Catalog-Abstammung, MLflow-Audit-Protokolle und Zugriffs-Governance für regulierte Umgebungen. Die Teilnehmer dokumentieren die Modellherkunft, um interne und externe Audit-Anforderungen zu erfüllen.
Lektion 2 • Lakehouse-Überwachung für ML
Führt die Databricks Lakehouse-Überwachung für die automatisierte Metrikberechnung auf Inferenztabellen ein. Bietet vorgefertigte Dashboards für Modellqualität und Datenintegrität.
Lektion 3 • MLOps-Prinzipien und Reifegrade
Definiert den MLOps-Reifegrad von manueller Experimentierung bis zu vollständig automatisierten Pipelines. Umreißt die Governance- und Automatisierungsziele, die die Teilnehmer in den folgenden Abschnitten umsetzen.
Lektion 4 • Erkennung von Daten- und Modelldrift
Behandelt statistische Tests für Kovariatenverschiebung, Label-Drift und Vorhersagedrift. Die Teilnehmer implementieren Drift-Warnungen, die automatisch Neutrainings-Pipelines auslösen.
Lektion 5 • Automatisierte Neutrainings-Pipelines
Erstellt auslöserbasierte und geplante Neutrainings-Workflows mit Databricks Jobs und Delta Live Tables. Hält Produktionsmodelle ohne manuelles Eingreifen aktuell.
Ihr gültiges Abschlusszertifikat
Dieser Kurs ist für Sie geeignet:
Data Scientists, die bereit sind, über lokale Notebooks hinaus in Cloud-skaliertes ML einzusteigen.
ML-Ingenieure, die strukturierte Workflows für das Deployment und die Überwachung von Modellen suchen.
Softwareentwickler, die in Machine-Learning-Rollen auf Cloud-Plattformen wechseln.
Analytics Engineers, die ihre Datenpipelines in das Modelltraining erweitern möchten.
Doktoranden, die akademisches ML-Wissen auf reale Unternehmensumgebungen anwenden.
BI-Entwickler, die neugierig darauf sind, auf Basis ihrer Daten prädiktive Systeme zu erstellen.
Was unsere Lernenden sagen
Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...

Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.

Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!

Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.

Wichtige Qualifikationen
FAQ
Wer ist Dedika?
Ist das Zertifikat in Deutschland gültig?
Sind die Kurse kostenlos?
Wie hoch ist der Arbeitsaufwand der Kurse?
Wie sind die Kurse aufgebaut?
Wie funktionieren die Kurse?
Wie lange dauern die Kurse?
Was kostet ein Kurs?
Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?
PDF-Kurs




















