Wählen Sie Ihre Sprache aus
Databricks ML Praxis-Kurs
Mehr als 2 Millionen Studierende weltweit

Databricks ML Praxis-Kurs

Meistern Sie End-to-End-Machine-Learning auf der Databricks Lakehouse Platform – von der Datenaufnahme und dem Feature Engineering über verteiltes Training, Model Serving bis hin zu produktivem MLOps. Dieser praxisorientierte Kurs stattet Data Scientists und ML-Ingenieure mit den Werkzeugen, Workflows und Governance-Praktiken aus, die echte Enterprise-KI-Systeme antreiben.

Dedika für Unternehmen

Was Sie lernen werden:

  • Konfigurieren Sie Databricks-Cluster, Speicherintegrationen und Unity Catalog für sichere ML-Workflows.

  • Erstellen Sie skalierbare Delta-Lake-Pipelines, die bereinigte, versionierte Daten für das Modelltraining liefern.

  • Entwerfen und verwalten Sie wiederverwendbare Feature-Tabellen mit dem Databricks Feature Store, um Trainings-Serving-Abweichungen zu vermeiden.

  • Verfolgen, registrieren und überführen Sie Modelle durch einen geregelten MLflow-Lebenszyklus vom Experiment bis zur Produktion.

  • Stellen Sie Echtzeit- und Batch-Inferenz-Endpunkte mit benutzerdefinierter PyFunc-Logik und automatisiertem Monitoring bereit.

  • Implementieren Sie CI/CD-Pipelines, Drift-Erkennung und automatisiertes Neutraining, um produktive ML-Systeme zuverlässig zu betreiben.

Wie Sie praxisnah lernen Databricks ML Praxis-Kurs

Wie Sie üben Databricks ML Praxis-Kurs

Für Unternehmen, die ihr Team schulen möchten

Bei Dedika für Unternehmen enthält der Kurs Übungen und Beispiele, die auf Ihr eigenes Geschäft und die Bedürfnisse Ihres Unternehmens zugeschnitten sind.

Hier klicken

Kursinhalt

8 Kapitel • 40 LektionenDauer zwischen 4 und 360 Stunden (Sie entscheiden)

Kapitel 1Details anzeigen

Databricks-Plattformgrundlagen

  • Lektion 1 • Notebooks und kollaborative Entwicklung

    Führt in die Notebook-Erstellung, Magic Commands und Funktionen für die gemeinsame Bearbeitung ein. Etabliert reproduzierbare Entwicklungspraktiken, die in allen späteren ML-Experimenten verwendet werden.

  • Lektion 2 • Arbeitsbereichsarchitektur und Navigation

    Behandelt die Databricks-Steuerungsebene, die Datenebene und die Benutzeroberfläche des Arbeitsbereichs. Verankert die Teilnehmer in der Umgebung, die sie in jedem folgenden Kapitel nutzen werden.

  • Lektion 3 • Datenzugriff und Speicherintegration

    Erläutert Mount Points, Unity Catalog und die Verwaltung von Anmeldeinformationen für Cloud-Speicher. Ermöglicht den sicheren, konsistenten Datenzugriff, der für ML-Pipelines erforderlich ist.

  • Lektion 4 • Databricks CLI und REST API-Grundlagen

    Führt die programmatische Arbeitsbereichssteuerung über CLI und REST-Endpunkte ein. Bereitet die Teilnehmer darauf vor, Aufgaben zu automatisieren und Databricks in externe Toolchains zu integrieren.

  • Lektion 5 • Cluster-Konfiguration und -Verwaltung

    Vermittelt Clustertypen, Laufzeitversionen und Richtlinien zur automatischen Skalierung. Die Teilnehmer konfigurieren Job- und interaktive Cluster, die für ML-Workloads geeignet sind.

Kapitel 2Details anzeigen

Data Engineering für ML-Pipelines

  • Lektion 1 • Delta Live Tables für Pipeline-Orchestrierung

    Führt deklarative Pipeline-Definitionen, Erwartungen und die Nachverfolgung der Abstammung ein. Automatisiert die mehrstufige Durchsetzung der Datenqualität, bevor Features das Modelltraining erreichen.

  • Lektion 2 • Datentransformation mit Spark SQL

    Behandelt Aggregationen, Fensterfunktionen und die Handhabung komplexer Typen in Spark SQL. Transformiert Rohdaten in strukturierte Features, die von ML-Modellen genutzt werden.

  • Lektion 3 • Apache Spark-Grundkonzepte

    Behandelt RDDs, DataFrames und das Spark-Ausführungsmodell. Bietet die rechnerische Grundlage für alle Datenverarbeitungsaufgaben in späteren ML-Kapiteln.

  • Lektion 4 • Delta Lake für ML-Workloads

    Führt ACID-Transaktionen, Zeitreisen und Delta-Tabellenoptimierung ein. Sorgt für Datenzuverlässigkeit und Reproduzierbarkeit bei iterativen ML-Experimenten.

  • Lektion 5 • Datenerfassungsmuster

    Lehrt Batch- und Streaming-Erfassung aus Dateien, Datenbanken und Ereignisströmen. Die Teilnehmer erstellen zuverlässige Source-to-Landing-Zone-Pipelines für die ML-Feature-Erstellung.

Kapitel 3Details anzeigen

Feature Engineering und der Feature Store

  • Lektion 1 • Beseitigung von Training-Serving-Skew

    Behandelt die Konsistenz zwischen Offline-Trainingsdaten und Online-Serving-Features. Die Teilnehmer implementieren lookup-basierte Trainingssets, die Produktionsinferenzpfade widerspiegeln.

  • Lektion 2 • Databricks Feature Store-Architektur

    Erläutert Feature Store-Tabellen, Metadaten und die Offline-Online-Aufteilung. Die Teilnehmer verstehen, wie Features gespeichert, versioniert und für Training und Serving abgerufen werden.

  • Lektion 3 • Schreiben und Lesen von Feature-Tabellen

    Lehrt die Schreib- und Lese-APIs für Batch- und Streaming-Feature-Aktualisierungen. Verbindet Erfassungspipelines aus Kapitel 2 mit nachgelagerten Modelltrainings-Workflows.

  • Lektion 4 • Feature Engineering-Grundlagen

    Behandelt Kodierung, Skalierung, Imputation und Interaktionsterme mit Spark. Etabliert das Feature-Vokabular, das in den Kapiteln zum Feature Store und Modelltraining angewendet wird.

  • Lektion 5 • Feature-Governance und -Wiederverwendung

    Behandelt Feature-Erkennung, Zugriffskontrolle und teamübergreifende Freigabe über Unity Catalog. Reduziert doppelten Engineering-Aufwand und setzt die Datenherkunft über ML-Projekte hinweg durch.

Kapitel 4Details anzeigen

Modelltraining mit MLflow

  • Lektion 1 • Training von Deep-Learning-Modellen

    Führt TensorFlow- und PyTorch-Trainingsschleifen ein, die in die MLflow-Protokollierung integriert sind. Bereitet die Teilnehmer auf das verteilte Deep Learning vor, das im Kapitel für fortgeschrittenes Training behandelt wird.

  • Lektion 2 • Hyperparameter-Tuning mit Hyperopt

    Lehrt Bayes'sche Optimierung und parallele Suche mit Hyperopt und SparkTrials. Die Teilnehmer verbessern die Modellleistung systematisch über die manuelle Rastersuche hinaus.

  • Lektion 3 • MLflow Tracking-Grundlagen

    Führt Experimente, Durchläufe, Parameter, Metriken und Tags in MLflow ein. Etabliert die Protokollierungsdisziplin, die dem reproduzierbaren ML während des gesamten Kurses zugrunde liegt.

  • Lektion 4 • Training von Scikit-learn- und Spark ML-Modellen

    Behandelt Pipeline-Konstruktion, Kreuzvalidierung und MLflow-Autologging für beide Frameworks. Die Teilnehmer trainieren und protokollieren Basismodelle, die als Benchmarks für fortgeschrittene Techniken dienen.

  • Lektion 5 • MLflow-Projekte und Reproduzierbarkeit

    Behandelt MLflow-Projekte, Einstiegspunkte und Umgebungsspezifikationen für portables Training. Ermöglicht Teams, jeden Experimentdurchlauf auf jedem kompatiblen Cluster zu reproduzieren.

Kapitel 5Details anzeigen

Modellregistrierung und Lebenszyklusmanagement

  • Lektion 1 • Registrieren und Versionieren von Modellen

    Lehrt die programmatische und UI-basierte Modellregistrierung aus MLflow-Durchläufen. Die Teilnehmer etablieren eine konsistente Versionierungsdisziplin für alle trainierten Modelle.

  • Lektion 2 • Phasenübergänge und Genehmigungs-Workflows

    Behandelt Übergänge in Staging, Produktion und Archivierung mit Webhook-basierten Benachrichtigungen. Implementiert einen kontrollierten Freigabeprozess, der den Unternehmens-MLOps-Standards entspricht.

  • Lektion 3 • Unity Catalog Model Registry

    Erläutert die Unity Catalog-gestützte Model Registry für die arbeitsbereichsübergreifende Governance. Die Teilnehmer migrieren von der Modellverwaltung auf Arbeitsbereichsebene zur Katalogebene für Unternehmensskalierung.

  • Lektion 4 • Modellsignaturen und Eingabebeispiele

    Führt MLflow-Modellsignaturen, Eingabebeispiele und Schema-Durchsetzung ein. Verhindert Laufzeittypfehler und dokumentiert erwartete Modellschnittstellen für nachgelagerte Nutzer.

  • Lektion 5 • MLflow Model Registry-Überblick

    Erläutert registrierte Modelle, Versionen, Phasen und Aliase in der Model Registry. Verbindet Experimentdurchläufe aus Kapitel 4 mit einer gesteuerten Freigabe-Pipeline.

Kapitel 6Details anzeigen

Skalierbares und verteiltes Modelltraining

  • Lektion 1 • Verteiltes Hyperparameter-Tuning in großem Maßstab

    Erweitert Hyperopt SparkTrials und führt Optuna für die groß angelegte parallele Suche ein. Die Teilnehmer optimieren Deep-Learning-Modelle effizient über Hunderte gleichzeitiger Versuche.

  • Lektion 2 • TorchDistributor für PyTorch-Training

    Führt TorchDistributor als native Databricks-API für verteiltes PyTorch ein. Die Teilnehmer starten Multi-GPU- und Multi-Node-PyTorch-Jobs ohne manuelle Cluster-Konfiguration.

  • Lektion 3 • Konzepte für verteiltes Training

    Behandelt Datenparallelität, Modellparallelität und Gradienten-Synchronisationsstrategien. Bietet die notwendige theoretische Grundlage vor der Implementierung verteilter Frameworks.

  • Lektion 4 • Horovod für verteiltes Deep Learning

    Lehrt Horovod-Initialisierung, rangbasiertes Data Sharding und HorovodRunner auf Databricks. Die Teilnehmer konvertieren Einzelknoten-Trainingsskripte in verteilte Multi-Node-Jobs.

  • Lektion 5 • Pandas-UDFs für verteilte Inferenz

    Behandelt skalare, gruppierte Map- und Iterator-Pandas-UDFs zur Anwendung von Modellen in Spark-Maßstab. Ermöglicht Batch-Inferenz auf Milliarden von Zeilen, ohne Daten vom Cluster zu verschieben.

Kapitel 7Details anzeigen

Modell-Deployment und Echtzeit-Serving

  • Lektion 1 • Databricks Model Serving-Architektur

    Erläutert serverloses Model Serving, Endpunkttypen und Traffic-Routing. Orientiert die Teilnehmer an der Serving-Schicht, bevor Live-Endpunkte konfiguriert und getestet werden.

  • Lektion 2 • Externe Deployment-Ziele

    Behandelt den Export von Modellen in ONNX, Docker-Container und Cloud-native Serving-Plattformen. Bereitet die Teilnehmer darauf vor, mit Databricks trainierte Modelle außerhalb der Databricks-Umgebung bereitzustellen.

  • Lektion 3 • Benutzerdefinierte Inferenzlogik mit PyFunc

    Lehrt den MLflow-PyFunc-Flavor zum Verpacken beliebiger Python-Logik als deploybares Modell. Die Teilnehmer fügen Serving-Endpunkten Vorverarbeitungs-, Nachverarbeitungs- und Ensemble-Logik hinzu.

  • Lektion 4 • Bereitstellen von MLflow-Modellen auf Endpunkten

    Behandelt Endpunkterstellung, Modellversions-Pinning und REST API-Aufrufe. Die Teilnehmer stellen registrierte Modelle aus Kapitel 5 bereit und validieren die Antworten vollständig.

  • Lektion 5 • Batch-Inferenz-Pipelines

    Implementiert geplantes Batch-Scoring mit Databricks Jobs und mlflow.pyfunc.spark_udf. Ergänzt das Echtzeit-Serving für Anwendungsfälle mit hohem Durchsatz und Latenztoleranz.

Kapitel 8Details anzeigen

MLOps, Überwachung und Produktions-Governance

  • Lektion 1 • Audit, Abstammung und Compliance

    Behandelt Unity Catalog-Abstammung, MLflow-Audit-Protokolle und Zugriffs-Governance für regulierte Umgebungen. Die Teilnehmer dokumentieren die Modellherkunft, um interne und externe Audit-Anforderungen zu erfüllen.

  • Lektion 2 • Lakehouse-Überwachung für ML

    Führt die Databricks Lakehouse-Überwachung für die automatisierte Metrikberechnung auf Inferenztabellen ein. Bietet vorgefertigte Dashboards für Modellqualität und Datenintegrität.

  • Lektion 3 • MLOps-Prinzipien und Reifegrade

    Definiert den MLOps-Reifegrad von manueller Experimentierung bis zu vollständig automatisierten Pipelines. Umreißt die Governance- und Automatisierungsziele, die die Teilnehmer in den folgenden Abschnitten umsetzen.

  • Lektion 4 • Erkennung von Daten- und Modelldrift

    Behandelt statistische Tests für Kovariatenverschiebung, Label-Drift und Vorhersagedrift. Die Teilnehmer implementieren Drift-Warnungen, die automatisch Neutrainings-Pipelines auslösen.

  • Lektion 5 • Automatisierte Neutrainings-Pipelines

    Erstellt auslöserbasierte und geplante Neutrainings-Workflows mit Databricks Jobs und Delta Live Tables. Hält Produktionsmodelle ohne manuelles Eingreifen aktuell.

Zertifizierung

Ihr gültiges Abschlusszertifikat

Dieser Kurs ist für Sie geeignet:

  • Data Scientists, die bereit sind, über lokale Notebooks hinaus in Cloud-skaliertes ML einzusteigen.

  • ML-Ingenieure, die strukturierte Workflows für das Deployment und die Überwachung von Modellen suchen.

  • Softwareentwickler, die in Machine-Learning-Rollen auf Cloud-Plattformen wechseln.

  • Analytics Engineers, die ihre Datenpipelines in das Modelltraining erweitern möchten.

  • Doktoranden, die akademisches ML-Wissen auf reale Unternehmensumgebungen anwenden.

  • BI-Entwickler, die neugierig darauf sind, auf Basis ihrer Daten prädiktive Systeme zu erstellen.

Was unsere Lernenden sagen

Ihre Kurse sind perfekt. Ich habe das Jahrespaket erworben und habe endlich die Möglichkeit, verschiedene Themen zu verfolgen, die mich interessieren, ohne die Plattform wechseln zu müssen... ich danke Ihnen für alles, was Sie tun, ich habe Sie bereits anderen Leuten empfohlen...
Giulio Carlo
Giulio CarloStudent für Digitales Marketing
Mir gefällt, wie die Lektionen direkt auf den Punkt kommen und wie ich Kapitel wechseln und Inhalte überspringen kann, die ich nicht brauche.
Mariana Ferres
Mariana FerresStudentin für Fotografie
Mir gefallen die Inhalte und die Art der Präsentation und Transkription der Videos, was den Prozess beschleunigt!
Luciana Alvarenga
Luciana AlvarengaStudentin für Nageldesign
Die Plattform ist schnell und einfach zu bedienen. Die Vielfalt der Inhalte und die ergänzenden Videos helfen sehr beim Lernen.
André Felipe
André FelipeStudent für Prompt Engineering

Wichtige Qualifikationen

FAQ

Wer ist Dedika?

Ist das Zertifikat in Deutschland gültig?

Sind die Kurse kostenlos?

Wie hoch ist der Arbeitsaufwand der Kurse?

Wie sind die Kurse aufgebaut?

Wie funktionieren die Kurse?

Wie lange dauern die Kurse?

Was kostet ein Kurs?

Was ist ein E-Learning- oder Online-Kurs und wie funktioniert er?

PDF-Kurs