
Apache Hive: Design, Query, and Optimize Big Data Course
Beheers Apache Hive van de grond af — ontwerp schema's, schrijf krachtige HiveQL-query's en stem de prestaties af op enorme datasets. Deze cursus behandelt alles van HDFS-grondbeginselen en ACID-transacties tot cloud-implementatie, beveiliging en workflow-orkestratie. Of je nu enterprise-datapijplijnen bouwt of een data lakehouse optimaliseert, je verwerft de praktische vaardigheden die productieomgevingen vereisen.
Wat je gaat leren:
Ontwerp beheerde en externe Hive-tabellen met partities, buckets en kolomgebaseerde opslagformaten.
Schrijf geavanceerde HiveQL-query's met behulp van vensterfuncties, CTE's, subquery's en joins tussen meerdere tabellen.
Optimaliseer de query-uitvoering door partitie-pruning, vectorisatie en tuning van de kostenoptimalisator toe te passen.
Implementeer Hive-beveiliging met Kerberos-authenticatie, Apache Ranger-beleid en dynamische datamaskering.
Integreer Hive met Apache Spark, cloud-objectopslag en open tabelformaten zoals Apache Iceberg.
Automatiseer datapijplijnen met Apache Airflow en Oozie, inclusief incrementeel laden en kwaliteitscontroles.
Hoe je praktisch studeert Apache Hive: Design, Query, and Optimize Big Data Course
Hoe je oefent Apache Hive: Design, Query, and Optimize Big Data Course
Voor bedrijven die hun team willen trainen
Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.
Cursusinhoud
8 Hoofdstukken • 37 LessenDuur tussen 4 en 360 uren (jij beslist)
Hoofdstuk 1VerbergenVerberg detailsBekijk detailsInleiding tot Big Data en Hive
Inleiding tot Big Data en Hive
Les 1 • Hive-architectuur en -componenten
Legt de kerncomponenten van Hive uit: metastore, stuurprogramma, compiler en uitvoeringsengine. Koppelt de architectuur aan het begrip van de querylevenscyclus.
Les 2 • Grondbeginselen en uitdagingen van Big Data
Behandelt de uitdagingen op het gebied van volume, snelheid en variëteit die de adoptie van big data aanjagen. Schetst de context voor het bestaan van gedistribueerde verwerkingstools zoals Hive.
Les 3 • Een Hive-omgeving opzetten
Begeleidt de installatie en configuratie van een lokale of sandbox Hive-omgeving. Biedt praktijkgerichte voorbereiding voor alle volgende hoofdstukken.
Les 4 • Hive versus traditionele databases
Contrasteert het schema-on-read-model van Hive met het RDBMS-schema-on-write. Studenten begrijpen wanneer Hive geschikt is versus relationele alternatieven.
Hoofdstuk 2VerbergenVerberg detailsBekijk detailsHiveQL-grondbeginselen en gegevenstypen
HiveQL-grondbeginselen en gegevenstypen
Les 1 • Primitieve en complexe gegevenstypen
Behandelt numerieke, string-, booleaanse en datum-primitieven naast de complexe typen ARRAY, MAP en STRUCT. De juiste typekeuze beïnvloedt de opslag en querynauwkeurigheid.
Les 2 • HiveQL-syntaxis en -querystructuur
Introduceert HiveQL als een SQL-dialect met Hive-specifieke uitbreidingen. Behandelt SELECT-, FROM-, WHERE- en ORDER BY-clausules als bouwstenen.
Les 3 • Aggregatie en groepering
Leert GROUP BY, HAVING en aggregatiefuncties voor het samenvatten van datasets. Aggregatie is fundamenteel voor de analytische querypatronen die in de hele cursus worden gebruikt.
Les 4 • Subquery's en Common Table Expressions
Introduceert inline views, subquery's en CTE's met de WITH-clausule voor modulair queryontwerp. Deze patronen komen in latere hoofdstukken voor in complexe analytische query's.
Les 5 • Ingebouwde functies en operatoren
Geeft een overzicht van ingebouwde functies voor strings, wiskunde, datum en conditionele bewerkingen. Studenten passen functies toe om gegevens binnen query's te transformeren en evalueren.
Hoofdstuk 3VerbergenVerberg detailsBekijk detailsDatabase- en tabelontwerp in Hive
Database- en tabelontwerp in Hive
Les 1 • Tabellen partitioneren
Leert statische en dynamische partitionering om full-table scans te verminderen. Partitioneren is de primaire techniek om de queryprestaties op grote tabellen te verbeteren.
Les 2 • Databases aanmaken en beheren
Behandelt CREATE DATABASE, DROP DATABASE en database-eigenschappen. Een goede databaseorganisatie ondersteunt datagovernance in multi-teamomgevingen.
Les 3 • Opslagformaten voor tabellen
Vergelijkt opslagformaten TextFile, SequenceFile, ORC en Parquet. De formatkeuze heeft directe invloed op de querysnelheid en opslagefficiëntie.
Les 4 • Beheerde versus externe tabellen
Onderscheidt beheerde tabellen (Hive-eigen gegevens) van externe tabellen (gebruiker-eigen gegevens). De juiste keuze voorkomt onbedoeld gegevensverlies.
Les 5 • Bucketen en clusteren
Introduceert bucketing als aanvulling op partitionering voor een uniforme gegevensverdeling. Gebuckete tabellen maken efficiënte sampling en join-optimalisatie mogelijk.
Hoofdstuk 4VerbergenVerberg detailsBekijk detailsGegevens laden, invoegen en beheren
Gegevens laden, invoegen en beheren
Les 1 • Gegevens laden uit bestanden
Behandelt LOAD DATA LOCAL en LOAD DATA vanaf HDFS-paden. Bestandsgebaseerd laden is het meest voorkomende eerste opnamepatroon in Hive-workflows.
Les 2 • ACID-transacties en CRUD-bewerkingen
Legt de ACID-ondersteuning van Hive uit die UPDATE en DELETE op ORC-tabellen mogelijk maakt. ACID-bewerkingen vereisen specifieke configuratie en tabeleigenschappen.
Les 3 • INSERT- en INSERT OVERWRITE-patronen
Leert INSERT INTO en INSERT OVERWRITE voor querygestuurde gegevenspopulatie. Deze patronen ondersteunen ETL-pijplijnen die volledig binnen HiveQL zijn gebouwd.
Les 4 • Gegevens exporteren en archiveren
Behandelt INSERT OVERWRITE DIRECTORY en de EXPORT-/IMPORT-opdrachten. Gegevensexport ondersteunt downstream-consumptie en cross-cluster-migratie.
Hoofdstuk 5VerbergenVerberg detailsBekijk detailsJoins, unions en geavanceerd query's uitvoeren
Joins, unions en geavanceerd query's uitvoeren
Les 1 • Skew-joins en omgaan met gegevensscheefheid
Behandelt joinscheefheid veroorzaakt door veelvoorkomende sleutelwaarden die reducers overbelasten. Skew-join-optimalisatie verdeelt hete sleutels over meerdere taken.
Les 2 • Jointypen en -syntaxis
Behandelt INNER-, LEFT-, RIGHT-, FULL OUTER- en CROSS-joins met HiveQL-syntaxis. Inzicht in join-semantiek voorkomt onjuiste resultaatsets.
Les 3 • UNION, INTERSECT en EXCEPT
Leert setbewerkingen voor het combineren en vergelijken van resultaatsets van verschillende query's. Deze bewerkingen ondersteunen patronen voor deduplicatie en verschilanalyse.
Les 4 • Map-side- en broadcast-joins
Legt map-side-joins uit met de MAPJOIN-hint voor optimalisatie van kleine tabellen. Broadcast-joins elimineren de shuffle-overhead bij joins tussen grote en kleine tabellen.
Les 5 • Vensterfuncties en analyses
Introduceert OVER, PARTITION BY en ORDER BY voor rangschikking en lopende aggregaties. Vensterfuncties maken geavanceerde analyses mogelijk zonder de rijgranulariteit te verliezen.
Hoofdstuk 6VerbergenVerberg detailsBekijk detailsTechnieken voor query-optimalisatie
Technieken voor query-optimalisatie
Les 1 • Het query-uitvoeringsplan begrijpen
Gebruikt EXPLAIN en EXPLAIN EXTENDED om MapReduce- en Tez-uitvoeringsplannen te interpreteren. Het lezen van plannen is de vereiste vaardigheid voor alle optimalisatiebeslissingen.
Les 2 • Tez-uitvoeringsengine afstemmen
Configureert Tez DAG-uitvoering voor verminderde latentie in vergelijking met MapReduce. Tez is de aanbevolen engine voor interactieve en iteratieve Hive-workloads.
Les 3 • Partitiepruning en predicate pushdown
Zorgt ervoor dat query's alleen relevante partities scannen en filters zo vroeg mogelijk toepassen. Deze technieken verminderen I/O, wat de dominante kostenpost is in Hive-query's.
Les 4 • Optimalisatie van bestandsformaat en compressie
Selecteer ORC en Parquet met geschikte compressie-codecs om de scantijd te minimaliseren. Compressie verlaagt zowel de opslagkosten als de netwerk-I/O tijdens query-uitvoering.
Les 5 • Vectorisatie en de Cost-Based Optimizer
Schakelt gevectoriseerde query-uitvoering en de Cost-Based Optimizer (CBO) in voor automatische planverbetering. Beide vereisen het verzamelen van statistieken om correct te functioneren.
Hoofdstuk 7VerbergenVerberg detailsBekijk detailsDoor de gebruiker gedefinieerde functies en uitbreidbaarheid
Door de gebruiker gedefinieerde functies en uitbreidbaarheid
Les 1 • Door de gebruiker gedefinieerde tabelfuncties
Bouwt UDTF's die meerdere rijen uit één invoerrij emitteren met behulp van de UDTF-interface. UDTF's ondersteunen het uiteenrafelen van geneste structuren en aangepaste rijgeneratie.
Les 2 • Door de gebruiker gedefinieerde aggregatiefuncties
Implementeert UDAF's met behulp van de UDAF- en GenericUDAF-interfaces voor aangepaste aggregaties. UDAF's werken over reducergroepen heen en vereisen buffermanagement.
Les 3 • Grondbeginselen van UDF-ontwikkeling
Behandelt de UDF-basisklasse, de evaluate-methode en JAR-verpakking voor eenvoudige scalaire functies. UDF's vullen gaten waar ingebouwde functies ontoereikend zijn.
Les 4 • Python- en scriptgebaseerde transformaties
Gebruikt TRANSFORM en streaming scripts om Python- of shell-logica binnen HiveQL toe te passen. Scripttransformaties maken snelle prototyping mogelijk zonder Java-compilatie.
Hoofdstuk 8VerbergenVerberg detailsBekijk detailsHive in productie: beveiliging en governance
Hive in productie: beveiliging en governance
Les 1 • Metastore-beheer en hoge beschikbaarheid
Configureert een externe metastore met een relationele backend en een hoge-beschikbaarheidsopstelling. Betrouwbaarheid van de metastore is cruciaal voor ononderbroken Hive-service in productie.
Les 2 • Autorisatiemodellen: SQL-standaarden en Ranger
Vergelijkt de SQL-standaardautorisatie van Hive met Apache Ranger-beleidsgestuurde controle. Fijnmazige autorisatie dwingt het principe van minimale privileges af op kolomniveau.
Les 3 • Authenticatie en Kerberos-integratie
Configureert op Kerberos gebaseerde authenticatie voor HiveServer2 en clientverbindingen. Authenticatie voorkomt onbevoegde toegang tot gevoelige gegevensactiva.
Les 4 • Datamaskering en encryptie
Past dynamisch datamaskeringsbeleid en HDFS-encryptiezones toe om gevoelige kolommen te beschermen. Maskering maakt analyses op gevoelige gegevens mogelijk zonder onbewerkte waarden bloot te geven.
Les 5 • Auditing en compliance-logboekregistratie
Schakelt query-auditlogboeken in via HiveServer2 en Apache Ranger-audit trails. Auditlogboeken voldoen aan wettelijke nalevingsvereisten voor het bijhouden van gegevenstoegang.
Jouw geldig certificaat van voltooiing
Deze cursus is voor jou:
Data-analisten die klaar zijn om hun vaardigheden uit te breiden voorbij spreadsheets en SQL.
Software-engineers die overstappen naar rollen in big data en gedistribueerde systemen.
ETL-ontwikkelaars die pipelines willen moderniseren met Hadoop-gebaseerde tooling.
Databasebeheerders die columnair opslag en grootschalige query-optimalisatie verkennen.
Business intelligence-professionals wier datasets de relationele databases zijn ontgroeid.
Cloud-engineers die belast zijn met het bouwen of migreren van datawarehouse-infrastructuur.
Wat onze studenten zeggen
Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...

Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.

Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!

Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.

Belangrijkste opleidingen
FAQ
Wie is Dedika?
Is het certificaat geldig in Nederland?
Zijn de cursussen gratis?
Wat is de studielast van de cursus?
Hoe zien de cursussen eruit?
Hoe werken de cursussen?
Wat is de duur van de cursussen?
Wat zijn de kosten of prijzen van de cursussen?
Wat is een EAD- of online cursus en hoe werkt het?
PDF-cursus




















