
Kurso sa Big Data Analysis
Maging dalubhasa sa buong big data stack — mula sa distributed storage at batch processing hanggang sa real-time streaming at machine learning sa scale. Ang kursong ito ay nagbibigay sa inyo ng hands-on na kadalubhasaan gamit ang mga tool na pamantayan sa industriya tulad ng Hadoop, Spark, Kafka, at Airflow. Kung kayo man ay pumapasok sa data engineering o pinapataas ang inyong kasalukuyang mga kasanayan, matatapos ninyo itong handa nang bumuo ng mga production-grade na big data system.
Ano ang iyong matututuhan:
Bubuo kayo ng kumpletong pag-unawa sa mga big data ecosystem, simula sa mga pangunahing konsepto at ang balangkas na 5 Vs, pagkatapos ay lilipat sa distributed storage gamit ang HDFS at mga NoSQL database. Magsusulat at mag-o-optimize kayo ng mga MapReduce job, magsasagawa ng mga SQL query sa mga distributed engine tulad ng Hive at Presto, at bubuo ng mga advanced na Spark application gamit ang mga RDD, DataFrame, at Spark SQL. Sinasaklaw ng kurso ang real-time stream processing gamit ang Kafka, Spark Structured Streaming, at Apache Flink. Mag-e-engineer kayo ng mga maaasahang data pipeline, titiyakin ang kalidad ng datos, at maglalapat ng machine learning sa scale gamit ang Spark MLlib at mga MLOps workflow. Ang mga cloud platform, data governance, seguridad, at mga umuusbong na trend tulad ng data mesh at AI-augmented engineering ang magbubuo sa inyong hanay ng kasanayan.
Paano ka mag-aaral nang praktikal Kurso sa Big Data Analysis
Paano ka magsasanay Kurso sa Big Data Analysis
Para sa mga negosyo na gustong sanayin ang kanilang team
Sa Dedika para sa mga negosyo, ang kurso ay may mga ehersisyo at halimbawa na akma sa iyong negosyo at ayon sa pangangailangan ng iyong kumpanya.
Nilalaman ng kurso
8 Kabanata • 38 Mga AralinTagal mula 4 hanggang 360 oras (ikaw ang magpapasya)
Kabanata 1ItagoItago ang mga detalyeTingnan ang mga detalyeMga Pundasyon ng Big Data
Mga Pundasyon ng Big Data
Aralin 1 • Mga Uri at Format ng Datos
Sumasaklaw sa structured, semi-structured, at unstructured na datos kasama ang mga karaniwang format ng file. Inihahanda ang mga mag-aaral na pumili ng angkop na mga estratehiya sa storage at processing.
Aralin 2 • Pagbibigay-Kahulugan sa mga Konsepto ng Big Data
Ipinakikilala ang 5 Vs framework at iniiba ang big data sa tradisyunal na datos. Iniangkla ang lahat ng kasunod na teknikal na paksa sa magkabahaging terminolohiya.
Aralin 3 • Mga Business Driver at Use Case
Sinusuri ang mga motibasyon ng industriya para sa pag-aampon ng big data at mga karaniwang layunin sa analitika. Ikinokonekta ang mga teknikal na konsepto sa masusukat na resulta ng negosyo.
Aralin 4 • Pangkalahatang-ideya ng Big Data Ecosystem
Imamapa ang mga pangunahing bahagi ng isang big data platform, mula sa ingestion hanggang sa visualization. Nagbibigay ng mental model para sa buong data pipeline na tatalakayin sa mga susunod na kabanata.
Kabanata 2ItagoItago ang mga detalyeTingnan ang mga detalyeMga Distributed Storage System
Mga Distributed Storage System
Aralin 1 • Mga Prinsipyo ng Distributed File System
Ipinapaliwanag ang replication, fault tolerance, at block storage sa mga distributed system. Itinatatag ang pundasyon ng storage na kinakailangan para sa lahat ng processing framework sa hinaharap.
Aralin 2 • Hadoop Distributed File System (HDFS)
Sumasaklaw sa arkitektura, configuration, at mga pangunahing operasyon ng HDFS para sa pag-iimbak ng malalaking dataset. Direktang nagbibigay-daan sa hands-on na trabaho sa Hadoop-based na processing sa mga susunod na kabanata.
Aralin 3 • Mga Pundamental ng NoSQL Database
Sinusuri ang key-value, document, column-family, at graph na mga modelo ng NoSQL. Inihahanda ang mga mag-aaral na itugma ang teknolohiya ng storage sa istruktura ng datos at mga kinakailangan sa query.
Aralin 4 • Object Storage para sa Big Data
Ipinakikilala ang cloud-native object storage bilang isang scalable na alternatibo sa HDFS. Inihahanda ang mga mag-aaral na mag-arkitekto ng hybrid at cloud-first na mga solusyon sa data lake.
Aralin 5 • Mga Pamamaraan ng Storage Optimization
Tinatalakay ang compression, partitioning, at tiered storage upang bawasan ang gastos at pagbutihin ang performance. Direktang naaangkop sa mga desisyon sa disenyo ng storage sa mga production environment.
Kabanata 3ItagoItago ang mga detalyeTingnan ang mga detalyeBatch Processing gamit ang MapReduce
Batch Processing gamit ang MapReduce
Aralin 1 • Modelo ng Programang MapReduce
Ipinapaliwanag ang mga yugto ng map, shuffle, at reduce gamit ang mga diagram ng data flow. Nagbibigay ng konseptwal na ubod na kinakailangan bago sumulat ng anumang distributed processing code.
Aralin 2 • Pagpapahusay ng Performance ng MapReduce
Sumasaklaw sa memory settings, speculative execution, at task parallelism para sa mas mabilis na trabaho. Ikinokonekta ang teoretikal na kaalaman sa masusukat na pagpapabuti ng performance.
Aralin 3 • Pagsulat ng mga MapReduce Job
Ginagabayan ang mga mag-aaral sa pag-code ng mga function ng mapper at reducer na may mga praktikal na halimbawa. Binubuo ang pundasyon ng programming para sa lahat ng kasunod na processing framework.
Aralin 4 • Mga Combiner at Partitioner
Ipinakikilala ang mga combiner para sa lokal na aggregation at custom partitioner para sa distribusyon ng datos. Direktang pinapabuti ang kahusayan ng trabaho at inihahanda ang mga mag-aaral para sa mga paksa ng optimization.
Kabanata 4ItagoItago ang mga detalyeTingnan ang mga detalyeSQL-Based na Big Data Processing
SQL-Based na Big Data Processing
Aralin 1 • Mga Distributed SQL Query Engine
Ipinakikilala ang mga MPP query engine na direktang nagpapatupad ng SQL sa distributed storage. Pinapalawak ang toolkit ng mga mag-aaral lampas sa Hive para sa interactive at ad hoc analytics.
Aralin 2 • Disenyo ng Schema para sa Analytics
Itinuturo ang star at snowflake schema, denormalization, at mga pattern ng schema-on-read. Inihahanda ang mga mag-aaral na magdisenyo ng mga istruktura ng data warehouse sa mga big data platform.
Aralin 3 • Arkitektura at Data Model ng Hive
Ipinapaliwanag ang Hive metastore, mga table, at HiveQL bilang isang SQL abstraction sa ibabaw ng HDFS. Binibigyang-daan ang mga mag-aaral na magamit ang umiiral na kasanayan sa SQL sa isang distributed na konteksto.
Aralin 4 • Query Optimization sa Hive
Sumasaklaw sa mga execution plan, vectorization, at cost-based optimization para sa mga query sa Hive. Direktang binabawasan ang latency ng query sa mga analytical pipeline na binuo sa kabanatang ito.
Aralin 5 • Arkitektura ng Data Lakehouse
Pinagsasama ang flexibility ng data lake sa pagiging maaasahan ng data warehouse gamit ang mga open table format. Inilalagay ang mga mag-aaral upang magdisenyo ng modernong pinag-isang arkitektura ng analytics.
Kabanata 5ItagoItago ang mga detalyeTingnan ang mga detalyePagproseso ng Malalaking Datos gamit ang Apache Spark
Pagproseso ng Malalaking Datos gamit ang Apache Spark
Aralin 1 • Arkitektura at Modelo ng Pagpapatupad ng Spark
Ipinapaliwanag ang driver, executor, DAG scheduler, at task execution sa mga Spark cluster. Nagbibigay ng pang-unawa sa arkitektura na kinakailangan upang sumulat at mag-tono ng mahusay na mga Spark job.
Aralin 2 • DataFrames at Spark SQL
Ipinakikilala ang DataFrame API at Spark SQL para sa structured data processing sa malalaking sukat. Ikinokonekta ang kaalaman sa SQL mula sa Kabanata 4 sa optimized na execution engine ng Spark.
Aralin 3 • Mga Advanced na Operasyon ng Spark
Sumasaklaw sa mga join, aggregation, window function, at user-defined function sa Spark. Binibigyang-daan ang mga mag-aaral na hawakan ang mga kumplikadong analytical transformation sa mga production pipeline.
Aralin 4 • Mga RDD at Pangunahing Transformation
Sumasaklaw sa Resilient Distributed Datasets, lazy evaluation, at mga pangunahing operasyon ng transformation. Binubuo ang pundasyonal na modelo ng programming ng Spark bago ang mga mas mataas na antas na API.
Aralin 5 • Pagpapahusay ng Performance ng Spark
Tinatalakay ang partitioning, pamamahala ng memory, at diagnostics ng Spark UI para sa optimization. Isinasalin ang kaalaman sa arkitektura sa masusukat na pagpapabuti ng performance ng trabaho.
Kabanata 6ItagoItago ang mga detalyeTingnan ang mga detalyeReal-Time Stream Processing
Real-Time Stream Processing
Aralin 1 • Message Queuing gamit ang Kafka
Sumasaklaw sa mga Kafka topic, partition, producer, at consumer bilang isang streaming backbone. Nagbibigay ng ingestion layer na kinakailangan ng lahat ng downstream stream processor.
Aralin 2 • Apache Spark Structured Streaming
Itinuturo ang micro-batch at tuloy-tuloy na streaming gamit ang pinag-isang DataFrame API ng Spark. Ginagamit ang mga kasanayan sa Spark mula sa mga kabanata ng batch at pinapalawak ang mga ito sa streaming workload.
Aralin 3 • Apache Flink Stream Processing
Ipinakikilala ang native streaming model, state backend, at event-time processing ng Flink. Nagbibigay ng alternatibo sa Spark para sa low-latency, stateful streaming application.
Aralin 4 • Mga Pattern ng Disenyo ng Real-Time Pipeline
Naglalahad ng mga arkitektura ng Lambda, Kappa, at CQRS para sa pagsasama ng batch at streaming. Inihahanda ang mga mag-aaral na mag-arkitekto ng end-to-end na real-time data system.
Aralin 5 • Mga Pundamental ng Stream Processing
Binibigyang-kahulugan ang mga event stream, time semantics, at ang mga pagkakaiba sa pagitan ng batch at streaming. Itinatatag ang konseptwal na baseline para sa lahat ng streaming framework sa kabanatang ito.
Kabanata 7ItagoItago ang mga detalyeTingnan ang mga detalyeInhinyeriya ng Data Pipeline
Inhinyeriya ng Data Pipeline
Aralin 1 • Kalidad at Pagpapatunay ng Datos
Ipinakikilala ang data profiling, schema validation, at automated quality checks sa mga pipeline. Tinitiyak na ang mga analytical output ay maaasahan at mapagkakatiwalaan para sa mga downstream consumer.
Aralin 2 • Workflow Orchestration gamit ang Airflow
Itinuturo ang DAG authoring, pag-iiskedyul, at pamamahala ng dependency sa Apache Airflow. Nagbibigay ng orchestration layer na nagko-coordinate sa lahat ng bahagi ng pipeline.
Aralin 3 • Mga Estratehiya ng Data Ingestion
Sumasaklaw sa batch ingestion, change data capture, at mga pattern ng event-driven ingestion. Itinatatag ang entry point para sa lahat ng datos na pumapasok sa mga pipeline na binuo sa kabanatang ito.
Aralin 4 • Pagiging Maaasahan at Pag-monitor ng Pipeline
Sumasaklaw sa idempotency, retry logic, dead-letter queue, at observability para sa mga pipeline. Inihahanda ang mga mag-aaral na mapanatili ang production-grade data infrastructure.
Aralin 5 • Mga Pattern ng Data Transformation
Naglalahad ng ELT vs. ETL, lohika ng transformation, at magagamit muli na mga balangkas ng transformation. Ikinokonekta ang mga layer ng ingestion at storage sa magkakaugnay na analytical data product.
Kabanata 8ItagoItago ang mga detalyeTingnan ang mga detalyeAdvanced Analytics at Machine Learning sa Malaking Sukat
Advanced Analytics at Machine Learning sa Malaking Sukat
Aralin 1 • MLOps para sa mga Big Data Pipeline
Naglalahad ng tuloy-tuloy na pagsasanay, feature store, at experiment tracking para sa scalable na operasyon ng ML. Binibigyang-daan ang mga mag-aaral na mapanatili at mapabuti ang mga modelo sa mga production environment.
Aralin 2 • Deployment at Serving ng Modelo
Sumasaklaw sa batch scoring, real-time inference, at mga pattern ng model registry para sa production ML. Tinutulay ang agwat sa pagitan ng pagsasanay ng modelo at operational na halaga ng negosyo.
Aralin 3 • Mga Konsepto ng Distributed Machine Learning
Ipinapaliwanag ang data parallelism, model parallelism, at distributed gradient descent. Itinatatag ang teoretikal na pundasyon para sa lahat ng ML framework na saklaw sa kabanatang ito.
Aralin 4 • Graph Analytics sa Malaking Sukat
Ipinakikilala ang mga graph data model at distributed graph processing para sa pagsusuri ng network. Pinapalawak ang mga kakayahan sa analitika sa mga problema sa big data na nakasentro sa relasyon.
Aralin 5 • Machine Learning gamit ang Spark MLlib
Sumasaklaw sa feature engineering, pipeline API, at mga pangunahing algorithm sa Spark MLlib. Ginagamit ang mga kasanayan sa Spark mula sa Kabanata 6 upang bumuo ng mga end-to-end ML workflow.
Ang iyong wastong sertipiko ng pagtatapos
Ang kursong ito ay para sa iyo:
Software developer: nais magpakadalubhasa sa data infrastructure at mga distributed system.
Data analyst: handa nang lumampas sa mga query tungo sa pag-e-engineer ng mga scalable na data workflow.
Backend engineer: naghahanap na palawakin ang kadalubhasaan sa mga kapaligiran ng high-volume na data processing.
Mag-aaral ng computer science: bumubuo ng mga praktikal na kasanayan upang makapasok sa job market ng data engineering.
BI developer: naghahanap ng mas malalim na teknikal na pundasyon sa ilalim ng mga dashboard at reporting layer.
Career changer mula sa IT operations: naakit sa data engineering sa pamamagitan ng karanasan sa infrastructure.
Ano ang sinasabi ng aming mga mag-aaral
Ang mga klase nila ay perpekto. Nakuha ko ang one-year package at sa wakas, may pagkakataon na akong sundan ang iba't ibang mga paksa na interesado ako nang hindi na kailangan lumipat ng platform... salamat sa lahat ng ginagawa ninyo, inirekomenda ko na kayo sa ibang mga tao...

Gusto ko kung paano direkta sa punto ang mga aralin at kung paano ko mababago ang mga kabanata at malaktawan ang mga content na hindi ko kailangan.

Gusto ko ang content at ang paraan ng pagpresenta at transcription ng mga video, na nagpapabilis sa proseso!

Ang platform ay mabilis, simple gamitin. Ang diversity ng content at ang mga supplementary videos ay nakakatulong talaga sa pag-aaral.

Pangunahing pagsasanay
FAQ
Sino ang Dedika?
Balido ba ang sertipiko sa Pilipinas?
Libre ba ang mga kurso?
Ano ang workload ng kurso?
Ano ang itsura ng mga kurso?
Paano gumagana ang mga kurso?
Gaano katagal ang mga kurso?
Magkano ang halaga ng mga kurso?
Ano ang EAD o online course at paano ito gumagana?
PDF Course




















