Piliin ang iyong wika
Kurso sa Big Data Analysis
Mahigit 2 milyong mag-aaral sa buong mundo ang gumagamit nito

Kurso sa Big Data Analysis

Maging dalubhasa sa buong big data stack — mula sa distributed storage at batch processing hanggang sa real-time streaming at machine learning sa scale. Ang kursong ito ay nagbibigay sa inyo ng hands-on na kadalubhasaan gamit ang mga tool na pamantayan sa industriya tulad ng Hadoop, Spark, Kafka, at Airflow. Kung kayo man ay pumapasok sa data engineering o pinapataas ang inyong kasalukuyang mga kasanayan, matatapos ninyo itong handa nang bumuo ng mga production-grade na big data system.

Dedika para sa mga negosyo

Ano ang iyong matututuhan:

Bubuo kayo ng kumpletong pag-unawa sa mga big data ecosystem, simula sa mga pangunahing konsepto at ang balangkas na 5 Vs, pagkatapos ay lilipat sa distributed storage gamit ang HDFS at mga NoSQL database. Magsusulat at mag-o-optimize kayo ng mga MapReduce job, magsasagawa ng mga SQL query sa mga distributed engine tulad ng Hive at Presto, at bubuo ng mga advanced na Spark application gamit ang mga RDD, DataFrame, at Spark SQL. Sinasaklaw ng kurso ang real-time stream processing gamit ang Kafka, Spark Structured Streaming, at Apache Flink. Mag-e-engineer kayo ng mga maaasahang data pipeline, titiyakin ang kalidad ng datos, at maglalapat ng machine learning sa scale gamit ang Spark MLlib at mga MLOps workflow. Ang mga cloud platform, data governance, seguridad, at mga umuusbong na trend tulad ng data mesh at AI-augmented engineering ang magbubuo sa inyong hanay ng kasanayan.

Paano ka mag-aaral nang praktikal Kurso sa Big Data Analysis

Paano ka magsasanay Kurso sa Big Data Analysis

Para sa mga negosyo na gustong sanayin ang kanilang team

Sa Dedika para sa mga negosyo, ang kurso ay may mga ehersisyo at halimbawa na akma sa iyong negosyo at ayon sa pangangailangan ng iyong kumpanya.

I-click dito

Nilalaman ng kurso

8 Kabanata • 38 Mga AralinTagal mula 4 hanggang 360 oras (ikaw ang magpapasya)

Kabanata 1Tingnan ang mga detalye

Mga Pundasyon ng Big Data

  • Aralin 1 • Mga Uri at Format ng Datos

    Sumasaklaw sa structured, semi-structured, at unstructured na datos kasama ang mga karaniwang format ng file. Inihahanda ang mga mag-aaral na pumili ng angkop na mga estratehiya sa storage at processing.

  • Aralin 2 • Pagbibigay-Kahulugan sa mga Konsepto ng Big Data

    Ipinakikilala ang 5 Vs framework at iniiba ang big data sa tradisyunal na datos. Iniangkla ang lahat ng kasunod na teknikal na paksa sa magkabahaging terminolohiya.

  • Aralin 3 • Mga Business Driver at Use Case

    Sinusuri ang mga motibasyon ng industriya para sa pag-aampon ng big data at mga karaniwang layunin sa analitika. Ikinokonekta ang mga teknikal na konsepto sa masusukat na resulta ng negosyo.

  • Aralin 4 • Pangkalahatang-ideya ng Big Data Ecosystem

    Imamapa ang mga pangunahing bahagi ng isang big data platform, mula sa ingestion hanggang sa visualization. Nagbibigay ng mental model para sa buong data pipeline na tatalakayin sa mga susunod na kabanata.

Kabanata 2Tingnan ang mga detalye

Mga Distributed Storage System

  • Aralin 1 • Mga Prinsipyo ng Distributed File System

    Ipinapaliwanag ang replication, fault tolerance, at block storage sa mga distributed system. Itinatatag ang pundasyon ng storage na kinakailangan para sa lahat ng processing framework sa hinaharap.

  • Aralin 2 • Hadoop Distributed File System (HDFS)

    Sumasaklaw sa arkitektura, configuration, at mga pangunahing operasyon ng HDFS para sa pag-iimbak ng malalaking dataset. Direktang nagbibigay-daan sa hands-on na trabaho sa Hadoop-based na processing sa mga susunod na kabanata.

  • Aralin 3 • Mga Pundamental ng NoSQL Database

    Sinusuri ang key-value, document, column-family, at graph na mga modelo ng NoSQL. Inihahanda ang mga mag-aaral na itugma ang teknolohiya ng storage sa istruktura ng datos at mga kinakailangan sa query.

  • Aralin 4 • Object Storage para sa Big Data

    Ipinakikilala ang cloud-native object storage bilang isang scalable na alternatibo sa HDFS. Inihahanda ang mga mag-aaral na mag-arkitekto ng hybrid at cloud-first na mga solusyon sa data lake.

  • Aralin 5 • Mga Pamamaraan ng Storage Optimization

    Tinatalakay ang compression, partitioning, at tiered storage upang bawasan ang gastos at pagbutihin ang performance. Direktang naaangkop sa mga desisyon sa disenyo ng storage sa mga production environment.

Kabanata 3Tingnan ang mga detalye

Batch Processing gamit ang MapReduce

  • Aralin 1 • Modelo ng Programang MapReduce

    Ipinapaliwanag ang mga yugto ng map, shuffle, at reduce gamit ang mga diagram ng data flow. Nagbibigay ng konseptwal na ubod na kinakailangan bago sumulat ng anumang distributed processing code.

  • Aralin 2 • Pagpapahusay ng Performance ng MapReduce

    Sumasaklaw sa memory settings, speculative execution, at task parallelism para sa mas mabilis na trabaho. Ikinokonekta ang teoretikal na kaalaman sa masusukat na pagpapabuti ng performance.

  • Aralin 3 • Pagsulat ng mga MapReduce Job

    Ginagabayan ang mga mag-aaral sa pag-code ng mga function ng mapper at reducer na may mga praktikal na halimbawa. Binubuo ang pundasyon ng programming para sa lahat ng kasunod na processing framework.

  • Aralin 4 • Mga Combiner at Partitioner

    Ipinakikilala ang mga combiner para sa lokal na aggregation at custom partitioner para sa distribusyon ng datos. Direktang pinapabuti ang kahusayan ng trabaho at inihahanda ang mga mag-aaral para sa mga paksa ng optimization.

Kabanata 4Tingnan ang mga detalye

SQL-Based na Big Data Processing

  • Aralin 1 • Mga Distributed SQL Query Engine

    Ipinakikilala ang mga MPP query engine na direktang nagpapatupad ng SQL sa distributed storage. Pinapalawak ang toolkit ng mga mag-aaral lampas sa Hive para sa interactive at ad hoc analytics.

  • Aralin 2 • Disenyo ng Schema para sa Analytics

    Itinuturo ang star at snowflake schema, denormalization, at mga pattern ng schema-on-read. Inihahanda ang mga mag-aaral na magdisenyo ng mga istruktura ng data warehouse sa mga big data platform.

  • Aralin 3 • Arkitektura at Data Model ng Hive

    Ipinapaliwanag ang Hive metastore, mga table, at HiveQL bilang isang SQL abstraction sa ibabaw ng HDFS. Binibigyang-daan ang mga mag-aaral na magamit ang umiiral na kasanayan sa SQL sa isang distributed na konteksto.

  • Aralin 4 • Query Optimization sa Hive

    Sumasaklaw sa mga execution plan, vectorization, at cost-based optimization para sa mga query sa Hive. Direktang binabawasan ang latency ng query sa mga analytical pipeline na binuo sa kabanatang ito.

  • Aralin 5 • Arkitektura ng Data Lakehouse

    Pinagsasama ang flexibility ng data lake sa pagiging maaasahan ng data warehouse gamit ang mga open table format. Inilalagay ang mga mag-aaral upang magdisenyo ng modernong pinag-isang arkitektura ng analytics.

Kabanata 5Tingnan ang mga detalye

Pagproseso ng Malalaking Datos gamit ang Apache Spark

  • Aralin 1 • Arkitektura at Modelo ng Pagpapatupad ng Spark

    Ipinapaliwanag ang driver, executor, DAG scheduler, at task execution sa mga Spark cluster. Nagbibigay ng pang-unawa sa arkitektura na kinakailangan upang sumulat at mag-tono ng mahusay na mga Spark job.

  • Aralin 2 • DataFrames at Spark SQL

    Ipinakikilala ang DataFrame API at Spark SQL para sa structured data processing sa malalaking sukat. Ikinokonekta ang kaalaman sa SQL mula sa Kabanata 4 sa optimized na execution engine ng Spark.

  • Aralin 3 • Mga Advanced na Operasyon ng Spark

    Sumasaklaw sa mga join, aggregation, window function, at user-defined function sa Spark. Binibigyang-daan ang mga mag-aaral na hawakan ang mga kumplikadong analytical transformation sa mga production pipeline.

  • Aralin 4 • Mga RDD at Pangunahing Transformation

    Sumasaklaw sa Resilient Distributed Datasets, lazy evaluation, at mga pangunahing operasyon ng transformation. Binubuo ang pundasyonal na modelo ng programming ng Spark bago ang mga mas mataas na antas na API.

  • Aralin 5 • Pagpapahusay ng Performance ng Spark

    Tinatalakay ang partitioning, pamamahala ng memory, at diagnostics ng Spark UI para sa optimization. Isinasalin ang kaalaman sa arkitektura sa masusukat na pagpapabuti ng performance ng trabaho.

Kabanata 6Tingnan ang mga detalye

Real-Time Stream Processing

  • Aralin 1 • Message Queuing gamit ang Kafka

    Sumasaklaw sa mga Kafka topic, partition, producer, at consumer bilang isang streaming backbone. Nagbibigay ng ingestion layer na kinakailangan ng lahat ng downstream stream processor.

  • Aralin 2 • Apache Spark Structured Streaming

    Itinuturo ang micro-batch at tuloy-tuloy na streaming gamit ang pinag-isang DataFrame API ng Spark. Ginagamit ang mga kasanayan sa Spark mula sa mga kabanata ng batch at pinapalawak ang mga ito sa streaming workload.

  • Aralin 3 • Apache Flink Stream Processing

    Ipinakikilala ang native streaming model, state backend, at event-time processing ng Flink. Nagbibigay ng alternatibo sa Spark para sa low-latency, stateful streaming application.

  • Aralin 4 • Mga Pattern ng Disenyo ng Real-Time Pipeline

    Naglalahad ng mga arkitektura ng Lambda, Kappa, at CQRS para sa pagsasama ng batch at streaming. Inihahanda ang mga mag-aaral na mag-arkitekto ng end-to-end na real-time data system.

  • Aralin 5 • Mga Pundamental ng Stream Processing

    Binibigyang-kahulugan ang mga event stream, time semantics, at ang mga pagkakaiba sa pagitan ng batch at streaming. Itinatatag ang konseptwal na baseline para sa lahat ng streaming framework sa kabanatang ito.

Kabanata 7Tingnan ang mga detalye

Inhinyeriya ng Data Pipeline

  • Aralin 1 • Kalidad at Pagpapatunay ng Datos

    Ipinakikilala ang data profiling, schema validation, at automated quality checks sa mga pipeline. Tinitiyak na ang mga analytical output ay maaasahan at mapagkakatiwalaan para sa mga downstream consumer.

  • Aralin 2 • Workflow Orchestration gamit ang Airflow

    Itinuturo ang DAG authoring, pag-iiskedyul, at pamamahala ng dependency sa Apache Airflow. Nagbibigay ng orchestration layer na nagko-coordinate sa lahat ng bahagi ng pipeline.

  • Aralin 3 • Mga Estratehiya ng Data Ingestion

    Sumasaklaw sa batch ingestion, change data capture, at mga pattern ng event-driven ingestion. Itinatatag ang entry point para sa lahat ng datos na pumapasok sa mga pipeline na binuo sa kabanatang ito.

  • Aralin 4 • Pagiging Maaasahan at Pag-monitor ng Pipeline

    Sumasaklaw sa idempotency, retry logic, dead-letter queue, at observability para sa mga pipeline. Inihahanda ang mga mag-aaral na mapanatili ang production-grade data infrastructure.

  • Aralin 5 • Mga Pattern ng Data Transformation

    Naglalahad ng ELT vs. ETL, lohika ng transformation, at magagamit muli na mga balangkas ng transformation. Ikinokonekta ang mga layer ng ingestion at storage sa magkakaugnay na analytical data product.

Kabanata 8Tingnan ang mga detalye

Advanced Analytics at Machine Learning sa Malaking Sukat

  • Aralin 1 • MLOps para sa mga Big Data Pipeline

    Naglalahad ng tuloy-tuloy na pagsasanay, feature store, at experiment tracking para sa scalable na operasyon ng ML. Binibigyang-daan ang mga mag-aaral na mapanatili at mapabuti ang mga modelo sa mga production environment.

  • Aralin 2 • Deployment at Serving ng Modelo

    Sumasaklaw sa batch scoring, real-time inference, at mga pattern ng model registry para sa production ML. Tinutulay ang agwat sa pagitan ng pagsasanay ng modelo at operational na halaga ng negosyo.

  • Aralin 3 • Mga Konsepto ng Distributed Machine Learning

    Ipinapaliwanag ang data parallelism, model parallelism, at distributed gradient descent. Itinatatag ang teoretikal na pundasyon para sa lahat ng ML framework na saklaw sa kabanatang ito.

  • Aralin 4 • Graph Analytics sa Malaking Sukat

    Ipinakikilala ang mga graph data model at distributed graph processing para sa pagsusuri ng network. Pinapalawak ang mga kakayahan sa analitika sa mga problema sa big data na nakasentro sa relasyon.

  • Aralin 5 • Machine Learning gamit ang Spark MLlib

    Sumasaklaw sa feature engineering, pipeline API, at mga pangunahing algorithm sa Spark MLlib. Ginagamit ang mga kasanayan sa Spark mula sa Kabanata 6 upang bumuo ng mga end-to-end ML workflow.

Sertipikasyon

Ang iyong wastong sertipiko ng pagtatapos

Ang kursong ito ay para sa iyo:

  • Software developer: nais magpakadalubhasa sa data infrastructure at mga distributed system.

  • Data analyst: handa nang lumampas sa mga query tungo sa pag-e-engineer ng mga scalable na data workflow.

  • Backend engineer: naghahanap na palawakin ang kadalubhasaan sa mga kapaligiran ng high-volume na data processing.

  • Mag-aaral ng computer science: bumubuo ng mga praktikal na kasanayan upang makapasok sa job market ng data engineering.

  • BI developer: naghahanap ng mas malalim na teknikal na pundasyon sa ilalim ng mga dashboard at reporting layer.

  • Career changer mula sa IT operations: naakit sa data engineering sa pamamagitan ng karanasan sa infrastructure.

Ano ang sinasabi ng aming mga mag-aaral

Ang mga klase nila ay perpekto. Nakuha ko ang one-year package at sa wakas, may pagkakataon na akong sundan ang iba't ibang mga paksa na interesado ako nang hindi na kailangan lumipat ng platform... salamat sa lahat ng ginagawa ninyo, inirekomenda ko na kayo sa ibang mga tao...
Giulio Carlo
Giulio CarloEstudyante ng Digital Marketing
Gusto ko kung paano direkta sa punto ang mga aralin at kung paano ko mababago ang mga kabanata at malaktawan ang mga content na hindi ko kailangan.
Mariana Ferres
Mariana FerresEstudyante ng Photography
Gusto ko ang content at ang paraan ng pagpresenta at transcription ng mga video, na nagpapabilis sa proseso!
Luciana Alvarenga
Luciana AlvarengaEstudyante ng Nail Design
Ang platform ay mabilis, simple gamitin. Ang diversity ng content at ang mga supplementary videos ay nakakatulong talaga sa pag-aaral.
André Felipe
André FelipeEstudyante ng Prompt Engineering

Pangunahing pagsasanay

FAQ

Sino ang Dedika?

Balido ba ang sertipiko sa Pilipinas?

Libre ba ang mga kurso?

Ano ang workload ng kurso?

Ano ang itsura ng mga kurso?

Paano gumagana ang mga kurso?

Gaano katagal ang mga kurso?

Magkano ang halaga ng mga kurso?

Ano ang EAD o online course at paano ito gumagana?

PDF Course