Pilih bahasa Anda
Apache Hive: Design, Query, and Optimize Big Data Course
Lebih dari 2 juta pelajar di seluruh dunia

Apache Hive: Design, Query, and Optimize Big Data Course

Kuasai Apache Hive dari dasar hingga mahir — merancang skema, menulis kueri HiveQL yang kuat, dan menyetel performa pada kumpulan data raksasa. Kursus ini mencakup segalanya mulai dari dasar-dasar HDFS dan transaksi ACID hingga penerapan cloud, keamanan, dan orkestrasi alur kerja. Baik Anda sedang membangun pipeline data perusahaan maupun mengoptimalkan data lakehouse, Anda akan memperoleh keterampilan langsung yang dibutuhkan oleh lingkungan produksi.

Dedika untuk bisnis

Apa yang akan Anda pelajari:

  • Rancang tabel Hive terkelola dan eksternal dengan partisi, bucketing, dan format penyimpanan kolom.

  • Tulis kueri HiveQL tingkat lanjut menggunakan fungsi jendela, CTE, subkueri, dan penggabungan multi-tabel.

  • Optimalkan eksekusi kueri dengan menerapkan pemangkasan partisi, vektorisasi, dan penyesuaian pengoptimal berbasis biaya.

  • Implementasikan keamanan Hive menggunakan autentikasi Kerberos, kebijakan Apache Ranger, dan penyamaran data dinamis.

  • Integrasikan Hive dengan Apache Spark, penyimpanan objek cloud, dan format tabel terbuka seperti Apache Iceberg.

  • Otomatiskan pipeline data dengan Apache Airflow dan Oozie, termasuk pemuatan inkremental dan pemeriksaan kualitas.

Bagaimana Anda belajar secara praktis Apache Hive: Design, Query, and Optimize Big Data Course

Bagaimana Anda berlatih Apache Hive: Design, Query, and Optimize Big Data Course

Untuk Anda yang memiliki perusahaan dan ingin melatih tim

Di Dedika untuk perusahaan, kursus dilengkapi dengan latihan dan contoh yang disesuaikan dengan bisnis Anda dan kebutuhan perusahaan Anda.

Klik di sini

Konten kursus

8 Bab • 37 PelajaranDurasi antara 4 dan 360 jam (Anda yang menentukan)

Bab 1Lihat detail

Pengantar Big Data dan Hive

  • Pelajaran 1 • Arsitektur dan Komponen Hive

    Menjelaskan komponen inti Hive: metastore, driver, kompiler, dan mesin eksekusi. Menghubungkan arsitektur dengan pemahaman siklus hidup kueri.

  • Pelajaran 2 • Fundamental Big Data dan Tantangannya

    Mencakup tantangan volume, kecepatan, dan variasi yang mendorong adopsi big data. Menetapkan konteks mengapa alat pemrosesan terdistribusi seperti Hive ada.

  • Pelajaran 3 • Menyiapkan Lingkungan Hive

    Memandu instalasi dan konfigurasi lingkungan Hive lokal atau sandbox. Memberikan kesiapan praktik untuk semua bab selanjutnya.

  • Pelajaran 4 • Hive vs. Database Tradisional

    Membandingkan model schema-on-read Hive dengan schema-on-write RDBMS. Mahasiswa memahami kapan Hive tepat digunakan dibandingkan alternatif relasional.

Bab 2Lihat detail

Fundamental HiveQL dan Tipe Data

  • Pelajaran 1 • Tipe Data Primitif dan Kompleks

    Mencakup primitif numerik, string, boolean, dan tanggal bersama tipe kompleks ARRAY, MAP, dan STRUCT. Pemilihan tipe yang benar memengaruhi penyimpanan dan akurasi kueri.

  • Pelajaran 2 • Sintaks HiveQL dan Struktur Kueri

    Memperkenalkan HiveQL sebagai dialek SQL dengan ekstensi khusus Hive. Mencakup klausa SELECT, FROM, WHERE, dan ORDER BY sebagai blok bangunan.

  • Pelajaran 3 • Agregasi dan Pengelompokan

    Mengajarkan GROUP BY, HAVING, dan fungsi agregat untuk meringkas dataset. Agregasi merupakan dasar pola kueri analitis yang digunakan di seluruh kursus.

  • Pelajaran 4 • Subkueri dan Common Table Expressions

    Memperkenalkan tampilan inline, subkueri, dan CTE klausa WITH untuk desain kueri modular. Pola-pola ini muncul dalam kueri analitis kompleks di bab-bab selanjutnya.

  • Pelajaran 5 • Fungsi dan Operator Bawaan

    Meninjau fungsi bawaan string, matematika, tanggal, dan kondisional. Mahasiswa menerapkan fungsi untuk mentransformasi dan mengevaluasi data dalam kueri.

Bab 3Lihat detail

Desain Database dan Tabel di Hive

  • Pelajaran 1 • Partisi Tabel

    Mengajarkan partisi statis dan dinamis untuk mengurangi pemindaian tabel penuh. Partisi adalah teknik utama untuk meningkatkan performa kueri pada tabel besar.

  • Pelajaran 2 • Membuat dan Mengelola Database

    Mencakup CREATE DATABASE, DROP DATABASE, dan properti database. Organisasi database yang tepat mendukung tata kelola data multi-tim.

  • Pelajaran 3 • Format Penyimpanan Tabel

    Membandingkan format penyimpanan TextFile, SequenceFile, ORC, dan Parquet. Pilihan format secara langsung berdampak pada kecepatan kueri dan efisiensi penyimpanan.

  • Pelajaran 4 • Tabel Terkelola vs. Eksternal

    Membedakan tabel terkelola (data milik Hive) dari tabel eksternal (data milik pengguna). Memilih dengan benar mencegah kehilangan data yang tidak disengaja.

  • Pelajaran 5 • Bucketing dan Clustering

    Memperkenalkan bucketing sebagai pelengkap partisi untuk distribusi data yang seragam. Tabel dengan bucketing memungkinkan pengambilan sampel yang efisien dan optimasi join.

Bab 4Lihat detail

Memuat, Menyisipkan, dan Mengelola Data

  • Pelajaran 1 • Memuat Data dari File

    Mencakup LOAD DATA LOCAL dan LOAD DATA dari jalur HDFS. Pemuatan berbasis file adalah pola injeksi awal yang paling umum dalam alur kerja Hive.

  • Pelajaran 2 • Transaksi ACID dan Operasi CRUD

    Menjelaskan dukungan ACID Hive yang memungkinkan UPDATE dan DELETE pada tabel ORC. Operasi ACID memerlukan konfigurasi dan properti tabel tertentu.

  • Pelajaran 3 • Pola INSERT dan INSERT OVERWRITE

    Mengajarkan INSERT INTO dan INSERT OVERWRITE untuk populasi data berbasis kueri. Pola-pola ini mendukung pipeline ETL yang dibangun sepenuhnya dalam HiveQL.

  • Pelajaran 4 • Mengekspor dan Mengarsipkan Data

    Mencakup perintah INSERT OVERWRITE DIRECTORY dan EXPORT/IMPORT. Ekspor data mendukung konsumsi hilir dan migrasi antar-kluster.

Bab 5Lihat detail

Join, Union, dan Kueri Tingkat Lanjut

  • Pelajaran 1 • Skew Join dan Penanganan Skew Data

    Mengatasi skew join yang disebabkan oleh nilai kunci frekuensi tinggi yang membebani reducer. Optimasi skew join mendistribusikan kunci panas ke beberapa tugas.

  • Pelajaran 2 • Jenis Join dan Sintaks

    Mencakup join INNER, LEFT, RIGHT, FULL OUTER, dan CROSS dengan sintaks HiveQL. Memahami semantik join mencegah kumpulan hasil yang salah.

  • Pelajaran 3 • UNION, INTERSECT, dan EXCEPT

    Mengajarkan operasi himpunan untuk menggabungkan dan membandingkan kumpulan hasil antar kueri. Operasi ini mendukung pola deduplikasi dan analisis diferensial.

  • Pelajaran 4 • Map-Side dan Broadcast Join

    Menjelaskan map-side join menggunakan petunjuk MAPJOIN untuk optimasi tabel kecil. Broadcast join menghilangkan overhead shuffle dalam join antara tabel besar dan kecil.

  • Pelajaran 5 • Fungsi Jendela dan Analitik

    Memperkenalkan OVER, PARTITION BY, dan ORDER BY untuk peringkat dan agregasi berjalan. Fungsi jendela memungkinkan analitik lanjutan tanpa mengurangi granularitas baris.

Bab 6Lihat detail

Teknik Optimasi Kueri

  • Pelajaran 1 • Memahami Rencana Eksekusi Kueri

    Menggunakan EXPLAIN dan EXPLAIN EXTENDED untuk menginterpretasi rencana eksekusi MapReduce dan Tez. Membaca rencana adalah keterampilan prasyarat untuk semua keputusan optimasi.

  • Pelajaran 2 • Penyetelan Mesin Eksekusi Tez

    Mengonfigurasi eksekusi DAG Tez untuk latensi yang lebih rendah dibandingkan MapReduce. Tez adalah mesin yang direkomendasikan untuk beban kerja Hive interaktif dan iteratif.

  • Pelajaran 3 • Pemangkasan Partisi dan Predicate Pushdown

    Memastikan kueri hanya memindai partisi yang relevan dan mendorong filter sedini mungkin. Teknik ini mengurangi I/O, yang merupakan biaya dominan dalam kueri Hive.

  • Pelajaran 4 • Optimasi Format File dan Kompresi

    Memilih ORC dan Parquet dengan codec kompresi yang sesuai untuk meminimalkan waktu pemindaian. Kompresi mengurangi biaya penyimpanan dan I/O jaringan selama eksekusi kueri.

  • Pelajaran 5 • Vektorisasi dan Pengoptimal Berbasis Biaya

    Mengaktifkan eksekusi kueri tervektorisasi dan pengoptimal berbasis biaya (CBO) untuk perbaikan rencana otomatis. Keduanya memerlukan pengumpulan statistik agar berfungsi dengan benar.

Bab 7Lihat detail

Fungsi Buatan Pengguna dan Ekstensibilitas

  • Pelajaran 1 • Fungsi Tabel Buatan Pengguna

    Membangun UDTF yang menghasilkan beberapa baris dari satu baris input menggunakan antarmuka UDTF. UDTF mendukung penguraian struktur bersarang dan pembuatan baris kustom.

  • Pelajaran 2 • Fungsi Agregat Buatan Pengguna

    Mengimplementasikan UDAF menggunakan antarmuka UDAF dan GenericUDAF untuk agregasi kustom. UDAF beroperasi di seluruh grup reducer dan memerlukan manajemen buffer.

  • Pelajaran 3 • Dasar Pengembangan UDF

    Mencakup kelas dasar UDF, metode evaluate, dan pengemasan JAR untuk fungsi skalar sederhana. UDF mengisi celah di mana fungsi bawaan tidak mencukupi.

  • Pelajaran 4 • Transformasi Berbasis Python dan Skrip

    Menggunakan TRANSFORM dan skrip streaming untuk menerapkan logika Python atau shell dalam HiveQL. Transformasi skrip memungkinkan pembuatan prototipe cepat tanpa kompilasi Java.

Bab 8Lihat detail

Hive di Produksi: Keamanan dan Tata Kelola

  • Pelajaran 1 • Manajemen Metastore dan Ketersediaan Tinggi

    Mengonfigurasi metastore jarak jauh dengan backend relasional dan pengaturan ketersediaan tinggi. Keandalan metastore sangat penting untuk layanan Hive yang tidak terputus di produksi.

  • Pelajaran 2 • Model Otorisasi: Standar SQL dan Ranger

    Membandingkan otorisasi standar SQL Hive dengan kontrol berbasis kebijakan Apache Ranger. Otorisasi terperinci menegakkan akses hak istimewa minimal di tingkat kolom.

  • Pelajaran 3 • Autentikasi dan Integrasi Kerberos

    Mengonfigurasi autentikasi berbasis Kerberos untuk HiveServer2 dan koneksi klien. Autentikasi mencegah akses tidak sah ke aset data sensitif.

  • Pelajaran 4 • Masking Data dan Enkripsi

    Menerapkan kebijakan masking data dinamis dan zona enkripsi HDFS untuk melindungi kolom sensitif. Masking memungkinkan analitik pada data sensitif tanpa mengekspos nilai mentah.

  • Pelajaran 5 • Audit dan Log Kepatuhan

    Mengaktifkan log audit kueri melalui HiveServer2 dan jejak audit Apache Ranger. Log audit memenuhi persyaratan kepatuhan regulasi untuk pelacakan akses data.

Sertifikasi

Sertifikat valid Anda setelah menyelesaikan

Kursus ini cocok untuk Anda:

  • Analis data yang siap meningkatkan keterampilan mereka melampaui spreadsheet dan SQL.

  • Insinyur perangkat lunak yang beralih ke peran big data dan sistem terdistribusi.

  • Pengembang ETL yang ingin memodernisasi pipeline menggunakan perangkat berbasis Hadoop.

  • Administrator basis data yang mengeksplorasi penyimpanan kolumnar dan penalaan kueri skala besar.

  • Profesional intelijen bisnis yang kumpulan datanya telah melampaui basis data relasional.

  • Insinyur cloud yang bertugas membangun atau memigrasikan infrastruktur gudang data.

Apa kata para siswa kami

Kelasnya sangat sempurna. Saya membeli paket satu tahun dan akhirnya memiliki kesempatan untuk mengikuti berbagai topik yang saya minati tanpa perlu berganti platform... terima kasih atas semua yang kalian lakukan, saya sudah merekomendasikan kalian kepada orang lain...
Giulio Carlo
Giulio CarloSiswa Marketing Digital
Saya suka bagaimana pelajarannya langsung pada intinya dan bagaimana saya bisa berpindah bab dan melewati konten yang tidak saya butuhkan.
Mariana Ferres
Mariana FerresSiswa Fotografi
Saya suka kontennya dan cara presentasi serta transkripsi videonya, yang mempercepat prosesnya!
Luciana Alvarenga
Luciana AlvarengaSiswa Desain Kuku
Platformnya cepat, mudah digunakan. Keragaman konten dan video pelengkapnya sangat membantu dalam pembelajaran.
André Felipe
André FelipeSiswa Prompt Engineering

Pelatihan utama

FAQ

Siapa itu Dedika?

Apakah sertifikat ini berlaku di Indonesia?

Apakah kursusnya gratis?

Berapa beban belajar kursusnya?

Bagaimana bentuk kursusnya?

Bagaimana cara kerja kursusnya?

Berapa lama durasi kursusnya?

Berapa biaya atau harga kursusnya?

Apa itu kursus EAD atau online dan bagaimana cara kerjanya?

Kursus PDF