Piliin ang iyong wika
Apache Hive: Design, Query, and Optimize Big Data Course
Mahigit 2 milyong mag-aaral sa buong mundo ang gumagamit nito

Apache Hive: Design, Query, and Optimize Big Data Course

Maging bihasa sa Apache Hive mula sa simula — pagdidisenyo ng mga schema, pagsusulat ng makapangyarihang mga query sa HiveQL, at pag-tune ng performance sa napakalalaking dataset. Saklaw ng kursong ito ang lahat mula sa mga pundamental ng HDFS at mga transaksyong ACID hanggang sa cloud deployment, seguridad, at orkestrasyon ng workflow. Bumubuo ka man ng mga enterprise data pipeline o nag-o-optimize ng isang data lakehouse, makakakuha kayo ng mga hands-on na kasanayan na hinihingi ng mga production environment.

Dedika para sa mga negosyo

Ano ang iyong matututuhan:

  • Magdisenyo ng managed at external na Hive table na may partitioning, bucketing, at columnar storage format.

  • Sumulat ng mga advanced na HiveQL query gamit ang window function, CTE, subquery, at multi-table join.

  • I-optimize ang pagpapatakbo ng query sa pamamagitan ng paglalapat ng partition pruning, vectorization, at pag-tune ng cost-based optimizer.

  • Ipatupad ang Hive security gamit ang Kerberos authentication, Apache Ranger policy, at dynamic data masking.

  • Isama ang Hive sa Apache Spark, cloud object storage, at open table format tulad ng Apache Iceberg.

  • I-automate ang mga data pipeline gamit ang Apache Airflow at Oozie, kabilang ang incremental loading at mga quality check.

Paano ka mag-aaral nang praktikal Apache Hive: Design, Query, and Optimize Big Data Course

Paano ka magsasanay Apache Hive: Design, Query, and Optimize Big Data Course

Para sa mga negosyo na gustong sanayin ang kanilang team

Sa Dedika para sa mga negosyo, ang kurso ay may mga ehersisyo at halimbawa na akma sa iyong negosyo at ayon sa pangangailangan ng iyong kumpanya.

I-click dito

Nilalaman ng kurso

8 Kabanata • 37 Mga AralinTagal mula 4 hanggang 360 oras (ikaw ang magpapasya)

Kabanata 1Tingnan ang mga detalye

Panimula sa Big Data at Hive

  • Aralin 1 • Arkitektura at Mga Bahagi ng Hive

    Ipinapaliwanag ang mga pangunahing bahagi ng Hive: metastore, driver, compiler, at execution engine. Ikinokonekta ang arkitektura sa pag-unawa sa lifecycle ng query.

  • Aralin 2 • Mga Pundamental at Hamon ng Big Data

    Sumasaklaw sa mga hamon ng volume, velocity, at variety na nagtutulak sa paggamit ng big data. Itinatatag ang konteksto kung bakit umiiral ang mga tool sa distributed processing tulad ng Hive.

  • Aralin 3 • Pag-set Up ng Hive Environment

    Gumagabay sa pag-install at pag-configure ng lokal o sandbox na Hive environment. Nagbibigay ng hands-on na kahandaan para sa lahat ng susunod na kabanata.

  • Aralin 4 • Hive kumpara sa Mga Tradisyonal na Database

    Inihahambing ang schema-on-read na modelo ng Hive sa schema-on-write ng RDBMS. Nauunawaan ng mga mag-aaral kung kailan angkop ang Hive kumpara sa mga alternatibong relational.

Kabanata 2Tingnan ang mga detalye

Mga Pundamental ng HiveQL at Mga Uri ng Datos

  • Aralin 1 • Mga Primitive at Complex na Uri ng Datos

    Sumasaklaw sa numeric, string, boolean, at date primitives kasama ang ARRAY, MAP, at STRUCT complex types. Ang tamang pagpili ng uri ay nakakaapekto sa storage at katumpakan ng query.

  • Aralin 2 • Syntax ng HiveQL at Istruktura ng Query

    Ipinakikilala ang HiveQL bilang isang SQL dialect na may mga extension na partikular sa Hive. Sumasaklaw sa SELECT, FROM, WHERE, at ORDER BY na mga sugnay bilang mga building block.

  • Aralin 3 • Aggregation at Grouping

    Itinuturo ang GROUP BY, HAVING, at mga aggregate function para sa pagbubuod ng mga dataset. Ang aggregation ay pundasyonal sa analytical query patterns na ginagamit sa buong kurso.

  • Aralin 4 • Mga Subquery at Common Table Expression

    Ipinakikilala ang mga inline view, subquery, at WITH clause CTEs para sa modular na disenyo ng query. Lumilitaw ang mga pattern na ito sa mga kumplikadong analytical query sa mga susunod na kabanata.

  • Aralin 5 • Mga Built-in Function at Operator

    Sinusuri ang string, math, date, at conditional na mga built-in function. Inilalapat ng mga mag-aaral ang mga function upang baguhin at suriin ang datos sa loob ng mga query.

Kabanata 3Tingnan ang mga detalye

Disenyo ng Database at Table sa Hive

  • Aralin 1 • Pagpa-partition ng Mga Table

    Itinuturo ang static at dynamic partitioning upang mabawasan ang full-table scan. Ang partitioning ang pangunahing pamamaraan para sa pagpapabuti ng query performance sa malalaking table.

  • Aralin 2 • Paglikha at Pamamahala ng Mga Database

    Sumasaklaw sa CREATE DATABASE, DROP DATABASE, at mga database property. Ang wastong organisasyon ng database ay sumusuporta sa multi-team data governance.

  • Aralin 3 • Mga Format ng Table Storage

    Inihahambing ang mga format ng storage na TextFile, SequenceFile, ORC, at Parquet. Ang pagpili ng format ay direktang nakakaapekto sa bilis ng query at kahusayan ng storage.

  • Aralin 4 • Managed kumpara sa External Tables

    Tinutukoy ang pagkakaiba ng managed tables (datos na pag-aari ng Hive) mula sa external tables (datos na pag-aari ng gumagamit). Ang tamang pagpili ay pumipigil sa aksidenteng pagkawala ng datos.

  • Aralin 5 • Bucketing at Clustering

    Ipinakikilala ang bucketing bilang pandagdag sa partitioning para sa pantay na pamamahagi ng datos. Ang mga bucketed table ay nagbibigay-daan sa mahusay na sampling at join optimization.

Kabanata 4Tingnan ang mga detalye

Paglo-load, Paglalagay, at Pamamahala ng Datos

  • Aralin 1 • Paglo-load ng Datos mula sa Mga File

    Sumasaklaw sa LOAD DATA LOCAL at LOAD DATA mula sa mga HDFS path. Ang file-based loading ang pinakakaraniwang paunang pattern ng ingestion sa mga Hive workflow.

  • Aralin 2 • Mga ACID Transaction at CRUD Operation

    Ipinapaliwanag ang suporta ng Hive ACID na nagbibigay-daan sa UPDATE at DELETE sa mga ORC table. Ang mga ACID operation ay nangangailangan ng partikular na configuration at mga table property.

  • Aralin 3 • Mga Pattern ng INSERT at INSERT OVERWRITE

    Itinuturo ang INSERT INTO at INSERT OVERWRITE para sa pagpupuno ng datos na hinimok ng query. Sinusuportahan ng mga pattern na ito ang mga ETL pipeline na ganap na binuo sa loob ng HiveQL.

  • Aralin 4 • Pag-export at Pag-archive ng Datos

    Sumasaklaw sa INSERT OVERWRITE DIRECTORY at mga utos na EXPORT/IMPORT. Sinusuportahan ng data export ang downstream consumption at cross-cluster migration.

Kabanata 5Tingnan ang mga detalye

Mga Join, Union, at Advanced Querying

  • Aralin 1 • Mga Skew Join at Pangangasiwa ng Data Skew

    Tinutugunan ang join skew na dulot ng mga high-frequency key value na nag-overload sa mga reducer. Ang skew join optimization ay namamahagi ng mga hot key sa maraming gawain.

  • Aralin 2 • Mga Uri ng Join at Syntax

    Sumasaklaw sa INNER, LEFT, RIGHT, FULL OUTER, at CROSS joins gamit ang HiveQL syntax. Ang pag-unawa sa join semantics ay pumipigil sa mga maling set ng resulta.

  • Aralin 3 • UNION, INTERSECT, at EXCEPT

    Itinuturo ang mga set operation para sa pagsasama at paghahambing ng mga set ng resulta sa mga query. Sinusuportahan ng mga operasyong ito ang mga pattern ng deduplication at differential analysis.

  • Aralin 4 • Map-Side at Broadcast Joins

    Ipinapaliwanag ang mga join sa gilid ng mapa gamit ang pahiwatig na MAPJOIN para sa pag-optimize ng maliit na talahanayan. Tinatanggal ng mga broadcast join ang overhead ng shuffle sa mga pagdugtong ng malaki-sa-maliit na talahanayan.

  • Aralin 5 • Window Functions at Analytics

    Ipinakikilala ang OVER, PARTITION BY, at ORDER BY para sa ranking at running aggregations. Ang window functions ay nagbibigay-daan sa advanced analytics nang hindi binabagsak ang row granularity.

Kabanata 6Tingnan ang mga detalye

Mga Pamamaraan sa Pag-optimize ng Query

  • Aralin 1 • Pag-unawa sa Query Execution Plan

    Gumagamit ng EXPLAIN at EXPLAIN EXTENDED upang bigyang-kahulugan ang mga execution plan ng MapReduce at Tez. Ang pagbabasa ng mga plano ay ang kinakailangang kasanayan para sa lahat ng desisyon sa pag-optimize.

  • Aralin 2 • Pag-tune ng Tez Execution Engine

    Kino-configure ang Tez DAG execution para sa pinababang latency kumpara sa MapReduce. Ang Tez ang inirerekomendang engine para sa interactive at iterative na mga Hive workload.

  • Aralin 3 • Partition Pruning at Predicate Pushdown

    Tinitiyak na ang mga query ay nag-i-scan lamang ng mga nauugnay na partition at itinutulak ang mga filter nang maaga hangga't maaari. Binabawasan ng mga pamamaraang ito ang I/O, na siyang pangunahing gastos sa mga query sa Hive.

  • Aralin 4 • Pag-optimize ng File Format at Compression

    Pumipili ng ORC at Parquet na may naaangkop na mga compression codec upang mabawasan ang oras ng pag-scan. Binabawasan ng compression ang parehong gastos sa storage at network I/O sa panahon ng query execution.

  • Aralin 5 • Vectorization at Cost-Based Optimizer

    Pinapagana ang vectorized query execution at ang cost-based optimizer (CBO) para sa awtomatikong pagpapabuti ng plano. Pareho silang nangangailangan ng statistics collection upang gumana nang tama.

Kabanata 7Tingnan ang mga detalye

Mga User-Defined Function at Extensibility

  • Aralin 1 • Mga User-Defined Table Function

    Bumubuo ng mga UDTF na naglalabas ng maraming row mula sa iisang input row gamit ang UDTF interface. Sinusuportahan ng mga UDTF ang pag-e-explode ng mga nested structure at custom row generation.

  • Aralin 2 • Mga User-Defined Aggregate Function

    Nagpapatupad ng mga UDAF gamit ang UDAF at GenericUDAF interfaces para sa custom aggregations. Ang mga UDAF ay gumagana sa mga reducer group at nangangailangan ng buffer management.

  • Aralin 3 • Mga Pundamental ng UDF Development

    Sumasaklaw sa UDF base class, evaluate method, at JAR packaging para sa mga simpleng scalar function. Pinupunan ng mga UDF ang mga puwang kung saan hindi sapat ang mga built-in function.

  • Aralin 4 • Python at Mga Script-Based Transform

    Gumagamit ng TRANSFORM at streaming scripts upang ilapat ang logic ng Python o shell sa loob ng HiveQL. Ang mga script transform ay nagbibigay-daan sa mabilis na prototyping nang walang Java compilation.

Kabanata 8Tingnan ang mga detalye

Hive sa Production: Seguridad at Governance

  • Aralin 1 • Pamamahala ng Metastore at High Availability

    Kino-configure ang isang remote metastore na may relational backend at high-availability setup. Ang pagiging maaasahan ng metastore ay kritikal para sa walang patid na serbisyo ng Hive sa production.

  • Aralin 2 • Mga Modelo ng Authorization: SQL Standards at Ranger

    Inihahambing ang Hive SQL standard authorization sa Apache Ranger policy-based control. Ang fine-grained authorization ay nagpapatupad ng least-privilege access sa antas ng column.

  • Aralin 3 • Authentication at Kerberos Integration

    Kino-configure ang Kerberos-based authentication para sa HiveServer2 at mga client connection. Pinipigilan ng authentication ang hindi awtorisadong pag-access sa mga sensitibong data asset.

  • Aralin 4 • Data Masking at Encryption

    Naglalapat ng mga dynamic data masking policy at HDFS encryption zones upang protektahan ang mga sensitibong column. Ang masking ay nagbibigay-daan sa analytics sa sensitibong datos nang hindi inilalantad ang mga raw value.

  • Aralin 5 • Auditing at Compliance Logging

    Pinapagana ang mga query audit log sa pamamagitan ng HiveServer2 at Apache Ranger audit trails. Natutugunan ng mga audit log ang mga kinakailangan sa regulasyon para sa pagsubaybay sa data access.

Sertipikasyon

Ang iyong wastong sertipiko ng pagtatapos

Ang kursong ito ay para sa iyo:

  • Mga data analyst na handang palawakin ang kanilang mga kasanayan lampas sa spreadsheets at SQL.

  • Mga software engineer na lumilipat sa mga papel sa big data at distributed systems.

  • Mga ETL developer na gustong i-modernisa ang mga pipeline gamit ang tooling na batay sa Hadoop.

  • Mga database administrator na sumusuri ng columnar storage at malakihang query tuning.

  • Mga propesyonal sa business intelligence na ang mga dataset ay lumaki na at hindi na akma sa relational database.

  • Mga cloud engineer na may tungkuling bumuo o mag-migrate ng data warehouse infrastructure.

Ano ang sinasabi ng aming mga mag-aaral

Ang mga klase nila ay perpekto. Nakuha ko ang one-year package at sa wakas, may pagkakataon na akong sundan ang iba't ibang mga paksa na interesado ako nang hindi na kailangan lumipat ng platform... salamat sa lahat ng ginagawa ninyo, inirekomenda ko na kayo sa ibang mga tao...
Giulio Carlo
Giulio CarloEstudyante ng Digital Marketing
Gusto ko kung paano direkta sa punto ang mga aralin at kung paano ko mababago ang mga kabanata at malaktawan ang mga content na hindi ko kailangan.
Mariana Ferres
Mariana FerresEstudyante ng Photography
Gusto ko ang content at ang paraan ng pagpresenta at transcription ng mga video, na nagpapabilis sa proseso!
Luciana Alvarenga
Luciana AlvarengaEstudyante ng Nail Design
Ang platform ay mabilis, simple gamitin. Ang diversity ng content at ang mga supplementary videos ay nakakatulong talaga sa pag-aaral.
André Felipe
André FelipeEstudyante ng Prompt Engineering

Pangunahing pagsasanay

FAQ

Sino ang Dedika?

Balido ba ang sertipiko sa Pilipinas?

Libre ba ang mga kurso?

Ano ang workload ng kurso?

Ano ang itsura ng mga kurso?

Paano gumagana ang mga kurso?

Gaano katagal ang mga kurso?

Magkano ang halaga ng mga kurso?

Ano ang EAD o online course at paano ito gumagana?

PDF Course