
Apache Hive: Design, Query, and Optimize Big Data Course
Kuasai Apache Hive dari dasar hingga mahir — merancang skema, menulis kueri HiveQL yang kuat, dan menyetel performa pada kumpulan data raksasa. Kursus ini mencakup segalanya mulai dari dasar-dasar HDFS dan transaksi ACID hingga penerapan cloud, keamanan, dan orkestrasi alur kerja. Baik Anda sedang membangun pipeline data perusahaan maupun mengoptimalkan data lakehouse, Anda akan memperoleh keterampilan langsung yang dibutuhkan oleh lingkungan produksi.
Apa yang akan Anda pelajari:
Rancang tabel Hive terkelola dan eksternal dengan partisi, bucketing, dan format penyimpanan kolom.
Tulis kueri HiveQL tingkat lanjut menggunakan fungsi jendela, CTE, subkueri, dan penggabungan multi-tabel.
Optimalkan eksekusi kueri dengan menerapkan pemangkasan partisi, vektorisasi, dan penyesuaian pengoptimal berbasis biaya.
Implementasikan keamanan Hive menggunakan autentikasi Kerberos, kebijakan Apache Ranger, dan penyamaran data dinamis.
Integrasikan Hive dengan Apache Spark, penyimpanan objek cloud, dan format tabel terbuka seperti Apache Iceberg.
Otomatiskan pipeline data dengan Apache Airflow dan Oozie, termasuk pemuatan inkremental dan pemeriksaan kualitas.
Bagaimana Anda belajar secara praktis Apache Hive: Design, Query, and Optimize Big Data Course
Bagaimana Anda berlatih Apache Hive: Design, Query, and Optimize Big Data Course
Untuk Anda yang memiliki perusahaan dan ingin melatih tim
Di Dedika untuk perusahaan, kursus dilengkapi dengan latihan dan contoh yang disesuaikan dengan bisnis Anda dan kebutuhan perusahaan Anda.
Konten kursus
8 Bab • 37 PelajaranDurasi antara 4 dan 360 jam (Anda yang menentukan)
Bab 1SembunyikanSembunyikan detailLihat detailPengantar Big Data dan Hive
Pengantar Big Data dan Hive
Pelajaran 1 • Arsitektur dan Komponen Hive
Menjelaskan komponen inti Hive: metastore, driver, kompiler, dan mesin eksekusi. Menghubungkan arsitektur dengan pemahaman siklus hidup kueri.
Pelajaran 2 • Fundamental Big Data dan Tantangannya
Mencakup tantangan volume, kecepatan, dan variasi yang mendorong adopsi big data. Menetapkan konteks mengapa alat pemrosesan terdistribusi seperti Hive ada.
Pelajaran 3 • Menyiapkan Lingkungan Hive
Memandu instalasi dan konfigurasi lingkungan Hive lokal atau sandbox. Memberikan kesiapan praktik untuk semua bab selanjutnya.
Pelajaran 4 • Hive vs. Database Tradisional
Membandingkan model schema-on-read Hive dengan schema-on-write RDBMS. Mahasiswa memahami kapan Hive tepat digunakan dibandingkan alternatif relasional.
Bab 2SembunyikanSembunyikan detailLihat detailFundamental HiveQL dan Tipe Data
Fundamental HiveQL dan Tipe Data
Pelajaran 1 • Tipe Data Primitif dan Kompleks
Mencakup primitif numerik, string, boolean, dan tanggal bersama tipe kompleks ARRAY, MAP, dan STRUCT. Pemilihan tipe yang benar memengaruhi penyimpanan dan akurasi kueri.
Pelajaran 2 • Sintaks HiveQL dan Struktur Kueri
Memperkenalkan HiveQL sebagai dialek SQL dengan ekstensi khusus Hive. Mencakup klausa SELECT, FROM, WHERE, dan ORDER BY sebagai blok bangunan.
Pelajaran 3 • Agregasi dan Pengelompokan
Mengajarkan GROUP BY, HAVING, dan fungsi agregat untuk meringkas dataset. Agregasi merupakan dasar pola kueri analitis yang digunakan di seluruh kursus.
Pelajaran 4 • Subkueri dan Common Table Expressions
Memperkenalkan tampilan inline, subkueri, dan CTE klausa WITH untuk desain kueri modular. Pola-pola ini muncul dalam kueri analitis kompleks di bab-bab selanjutnya.
Pelajaran 5 • Fungsi dan Operator Bawaan
Meninjau fungsi bawaan string, matematika, tanggal, dan kondisional. Mahasiswa menerapkan fungsi untuk mentransformasi dan mengevaluasi data dalam kueri.
Bab 3SembunyikanSembunyikan detailLihat detailDesain Database dan Tabel di Hive
Desain Database dan Tabel di Hive
Pelajaran 1 • Partisi Tabel
Mengajarkan partisi statis dan dinamis untuk mengurangi pemindaian tabel penuh. Partisi adalah teknik utama untuk meningkatkan performa kueri pada tabel besar.
Pelajaran 2 • Membuat dan Mengelola Database
Mencakup CREATE DATABASE, DROP DATABASE, dan properti database. Organisasi database yang tepat mendukung tata kelola data multi-tim.
Pelajaran 3 • Format Penyimpanan Tabel
Membandingkan format penyimpanan TextFile, SequenceFile, ORC, dan Parquet. Pilihan format secara langsung berdampak pada kecepatan kueri dan efisiensi penyimpanan.
Pelajaran 4 • Tabel Terkelola vs. Eksternal
Membedakan tabel terkelola (data milik Hive) dari tabel eksternal (data milik pengguna). Memilih dengan benar mencegah kehilangan data yang tidak disengaja.
Pelajaran 5 • Bucketing dan Clustering
Memperkenalkan bucketing sebagai pelengkap partisi untuk distribusi data yang seragam. Tabel dengan bucketing memungkinkan pengambilan sampel yang efisien dan optimasi join.
Bab 4SembunyikanSembunyikan detailLihat detailMemuat, Menyisipkan, dan Mengelola Data
Memuat, Menyisipkan, dan Mengelola Data
Pelajaran 1 • Memuat Data dari File
Mencakup LOAD DATA LOCAL dan LOAD DATA dari jalur HDFS. Pemuatan berbasis file adalah pola injeksi awal yang paling umum dalam alur kerja Hive.
Pelajaran 2 • Transaksi ACID dan Operasi CRUD
Menjelaskan dukungan ACID Hive yang memungkinkan UPDATE dan DELETE pada tabel ORC. Operasi ACID memerlukan konfigurasi dan properti tabel tertentu.
Pelajaran 3 • Pola INSERT dan INSERT OVERWRITE
Mengajarkan INSERT INTO dan INSERT OVERWRITE untuk populasi data berbasis kueri. Pola-pola ini mendukung pipeline ETL yang dibangun sepenuhnya dalam HiveQL.
Pelajaran 4 • Mengekspor dan Mengarsipkan Data
Mencakup perintah INSERT OVERWRITE DIRECTORY dan EXPORT/IMPORT. Ekspor data mendukung konsumsi hilir dan migrasi antar-kluster.
Bab 5SembunyikanSembunyikan detailLihat detailJoin, Union, dan Kueri Tingkat Lanjut
Join, Union, dan Kueri Tingkat Lanjut
Pelajaran 1 • Skew Join dan Penanganan Skew Data
Mengatasi skew join yang disebabkan oleh nilai kunci frekuensi tinggi yang membebani reducer. Optimasi skew join mendistribusikan kunci panas ke beberapa tugas.
Pelajaran 2 • Jenis Join dan Sintaks
Mencakup join INNER, LEFT, RIGHT, FULL OUTER, dan CROSS dengan sintaks HiveQL. Memahami semantik join mencegah kumpulan hasil yang salah.
Pelajaran 3 • UNION, INTERSECT, dan EXCEPT
Mengajarkan operasi himpunan untuk menggabungkan dan membandingkan kumpulan hasil antar kueri. Operasi ini mendukung pola deduplikasi dan analisis diferensial.
Pelajaran 4 • Map-Side dan Broadcast Join
Menjelaskan map-side join menggunakan petunjuk MAPJOIN untuk optimasi tabel kecil. Broadcast join menghilangkan overhead shuffle dalam join antara tabel besar dan kecil.
Pelajaran 5 • Fungsi Jendela dan Analitik
Memperkenalkan OVER, PARTITION BY, dan ORDER BY untuk peringkat dan agregasi berjalan. Fungsi jendela memungkinkan analitik lanjutan tanpa mengurangi granularitas baris.
Bab 6SembunyikanSembunyikan detailLihat detailTeknik Optimasi Kueri
Teknik Optimasi Kueri
Pelajaran 1 • Memahami Rencana Eksekusi Kueri
Menggunakan EXPLAIN dan EXPLAIN EXTENDED untuk menginterpretasi rencana eksekusi MapReduce dan Tez. Membaca rencana adalah keterampilan prasyarat untuk semua keputusan optimasi.
Pelajaran 2 • Penyetelan Mesin Eksekusi Tez
Mengonfigurasi eksekusi DAG Tez untuk latensi yang lebih rendah dibandingkan MapReduce. Tez adalah mesin yang direkomendasikan untuk beban kerja Hive interaktif dan iteratif.
Pelajaran 3 • Pemangkasan Partisi dan Predicate Pushdown
Memastikan kueri hanya memindai partisi yang relevan dan mendorong filter sedini mungkin. Teknik ini mengurangi I/O, yang merupakan biaya dominan dalam kueri Hive.
Pelajaran 4 • Optimasi Format File dan Kompresi
Memilih ORC dan Parquet dengan codec kompresi yang sesuai untuk meminimalkan waktu pemindaian. Kompresi mengurangi biaya penyimpanan dan I/O jaringan selama eksekusi kueri.
Pelajaran 5 • Vektorisasi dan Pengoptimal Berbasis Biaya
Mengaktifkan eksekusi kueri tervektorisasi dan pengoptimal berbasis biaya (CBO) untuk perbaikan rencana otomatis. Keduanya memerlukan pengumpulan statistik agar berfungsi dengan benar.
Bab 7SembunyikanSembunyikan detailLihat detailFungsi Buatan Pengguna dan Ekstensibilitas
Fungsi Buatan Pengguna dan Ekstensibilitas
Pelajaran 1 • Fungsi Tabel Buatan Pengguna
Membangun UDTF yang menghasilkan beberapa baris dari satu baris input menggunakan antarmuka UDTF. UDTF mendukung penguraian struktur bersarang dan pembuatan baris kustom.
Pelajaran 2 • Fungsi Agregat Buatan Pengguna
Mengimplementasikan UDAF menggunakan antarmuka UDAF dan GenericUDAF untuk agregasi kustom. UDAF beroperasi di seluruh grup reducer dan memerlukan manajemen buffer.
Pelajaran 3 • Dasar Pengembangan UDF
Mencakup kelas dasar UDF, metode evaluate, dan pengemasan JAR untuk fungsi skalar sederhana. UDF mengisi celah di mana fungsi bawaan tidak mencukupi.
Pelajaran 4 • Transformasi Berbasis Python dan Skrip
Menggunakan TRANSFORM dan skrip streaming untuk menerapkan logika Python atau shell dalam HiveQL. Transformasi skrip memungkinkan pembuatan prototipe cepat tanpa kompilasi Java.
Bab 8SembunyikanSembunyikan detailLihat detailHive di Produksi: Keamanan dan Tata Kelola
Hive di Produksi: Keamanan dan Tata Kelola
Pelajaran 1 • Manajemen Metastore dan Ketersediaan Tinggi
Mengonfigurasi metastore jarak jauh dengan backend relasional dan pengaturan ketersediaan tinggi. Keandalan metastore sangat penting untuk layanan Hive yang tidak terputus di produksi.
Pelajaran 2 • Model Otorisasi: Standar SQL dan Ranger
Membandingkan otorisasi standar SQL Hive dengan kontrol berbasis kebijakan Apache Ranger. Otorisasi terperinci menegakkan akses hak istimewa minimal di tingkat kolom.
Pelajaran 3 • Autentikasi dan Integrasi Kerberos
Mengonfigurasi autentikasi berbasis Kerberos untuk HiveServer2 dan koneksi klien. Autentikasi mencegah akses tidak sah ke aset data sensitif.
Pelajaran 4 • Masking Data dan Enkripsi
Menerapkan kebijakan masking data dinamis dan zona enkripsi HDFS untuk melindungi kolom sensitif. Masking memungkinkan analitik pada data sensitif tanpa mengekspos nilai mentah.
Pelajaran 5 • Audit dan Log Kepatuhan
Mengaktifkan log audit kueri melalui HiveServer2 dan jejak audit Apache Ranger. Log audit memenuhi persyaratan kepatuhan regulasi untuk pelacakan akses data.
Sertifikat valid Anda setelah menyelesaikan
Kursus ini cocok untuk Anda:
Analis data yang siap meningkatkan keterampilan mereka melampaui spreadsheet dan SQL.
Insinyur perangkat lunak yang beralih ke peran big data dan sistem terdistribusi.
Pengembang ETL yang ingin memodernisasi pipeline menggunakan perangkat berbasis Hadoop.
Administrator basis data yang mengeksplorasi penyimpanan kolumnar dan penalaan kueri skala besar.
Profesional intelijen bisnis yang kumpulan datanya telah melampaui basis data relasional.
Insinyur cloud yang bertugas membangun atau memigrasikan infrastruktur gudang data.
Apa kata para siswa kami
Kelasnya sangat sempurna. Saya membeli paket satu tahun dan akhirnya memiliki kesempatan untuk mengikuti berbagai topik yang saya minati tanpa perlu berganti platform... terima kasih atas semua yang kalian lakukan, saya sudah merekomendasikan kalian kepada orang lain...

Saya suka bagaimana pelajarannya langsung pada intinya dan bagaimana saya bisa berpindah bab dan melewati konten yang tidak saya butuhkan.

Saya suka kontennya dan cara presentasi serta transkripsi videonya, yang mempercepat prosesnya!

Platformnya cepat, mudah digunakan. Keragaman konten dan video pelengkapnya sangat membantu dalam pembelajaran.

Pelatihan utama
FAQ
Siapa itu Dedika?
Apakah sertifikat ini berlaku di Indonesia?
Apakah kursusnya gratis?
Berapa beban belajar kursusnya?
Bagaimana bentuk kursusnya?
Bagaimana cara kerja kursusnya?
Berapa lama durasi kursusnya?
Berapa biaya atau harga kursusnya?
Apa itu kursus EAD atau online dan bagaimana cara kerjanya?
Kursus PDF




















