Kies uw taal
Apache Hive: Design, Query, and Optimize Big Data Course
Meer dan 2 miljoen studenten wereldwijd

Apache Hive: Design, Query, and Optimize Big Data Course

Beheers Apache Hive van de grond af — ontwerp schema's, schrijf krachtige HiveQL-query's en stem de prestaties af op enorme datasets. Deze cursus behandelt alles van HDFS-grondbeginselen en ACID-transacties tot cloud-implementatie, beveiliging en workflow-orkestratie. Of je nu enterprise-datapijplijnen bouwt of een data lakehouse optimaliseert, je verwerft de praktische vaardigheden die productieomgevingen vereisen.

Dedika voor bedrijven

Wat je gaat leren:

  • Ontwerp beheerde en externe Hive-tabellen met partities, buckets en kolomgebaseerde opslagformaten.

  • Schrijf geavanceerde HiveQL-query's met behulp van vensterfuncties, CTE's, subquery's en joins tussen meerdere tabellen.

  • Optimaliseer de query-uitvoering door partitie-pruning, vectorisatie en tuning van de kostenoptimalisator toe te passen.

  • Implementeer Hive-beveiliging met Kerberos-authenticatie, Apache Ranger-beleid en dynamische datamaskering.

  • Integreer Hive met Apache Spark, cloud-objectopslag en open tabelformaten zoals Apache Iceberg.

  • Automatiseer datapijplijnen met Apache Airflow en Oozie, inclusief incrementeel laden en kwaliteitscontroles.

Hoe je praktisch studeert Apache Hive: Design, Query, and Optimize Big Data Course

Hoe je oefent Apache Hive: Design, Query, and Optimize Big Data Course

Voor bedrijven die hun team willen trainen

Bij Dedika voor bedrijven bevat de cursus oefeningen en voorbeelden die zijn afgestemd op jouw organisatie en precies zoals jouw bedrijf het nodig heeft.

Klik hier

Cursusinhoud

8 Hoofdstukken • 37 LessenDuur tussen 4 en 360 uren (jij beslist)

Hoofdstuk 1Bekijk details

Inleiding tot Big Data en Hive

  • Les 1 • Hive-architectuur en -componenten

    Legt de kerncomponenten van Hive uit: metastore, stuurprogramma, compiler en uitvoeringsengine. Koppelt de architectuur aan het begrip van de querylevenscyclus.

  • Les 2 • Grondbeginselen en uitdagingen van Big Data

    Behandelt de uitdagingen op het gebied van volume, snelheid en variëteit die de adoptie van big data aanjagen. Schetst de context voor het bestaan van gedistribueerde verwerkingstools zoals Hive.

  • Les 3 • Een Hive-omgeving opzetten

    Begeleidt de installatie en configuratie van een lokale of sandbox Hive-omgeving. Biedt praktijkgerichte voorbereiding voor alle volgende hoofdstukken.

  • Les 4 • Hive versus traditionele databases

    Contrasteert het schema-on-read-model van Hive met het RDBMS-schema-on-write. Studenten begrijpen wanneer Hive geschikt is versus relationele alternatieven.

Hoofdstuk 2Bekijk details

HiveQL-grondbeginselen en gegevenstypen

  • Les 1 • Primitieve en complexe gegevenstypen

    Behandelt numerieke, string-, booleaanse en datum-primitieven naast de complexe typen ARRAY, MAP en STRUCT. De juiste typekeuze beïnvloedt de opslag en querynauwkeurigheid.

  • Les 2 • HiveQL-syntaxis en -querystructuur

    Introduceert HiveQL als een SQL-dialect met Hive-specifieke uitbreidingen. Behandelt SELECT-, FROM-, WHERE- en ORDER BY-clausules als bouwstenen.

  • Les 3 • Aggregatie en groepering

    Leert GROUP BY, HAVING en aggregatiefuncties voor het samenvatten van datasets. Aggregatie is fundamenteel voor de analytische querypatronen die in de hele cursus worden gebruikt.

  • Les 4 • Subquery's en Common Table Expressions

    Introduceert inline views, subquery's en CTE's met de WITH-clausule voor modulair queryontwerp. Deze patronen komen in latere hoofdstukken voor in complexe analytische query's.

  • Les 5 • Ingebouwde functies en operatoren

    Geeft een overzicht van ingebouwde functies voor strings, wiskunde, datum en conditionele bewerkingen. Studenten passen functies toe om gegevens binnen query's te transformeren en evalueren.

Hoofdstuk 3Bekijk details

Database- en tabelontwerp in Hive

  • Les 1 • Tabellen partitioneren

    Leert statische en dynamische partitionering om full-table scans te verminderen. Partitioneren is de primaire techniek om de queryprestaties op grote tabellen te verbeteren.

  • Les 2 • Databases aanmaken en beheren

    Behandelt CREATE DATABASE, DROP DATABASE en database-eigenschappen. Een goede databaseorganisatie ondersteunt datagovernance in multi-teamomgevingen.

  • Les 3 • Opslagformaten voor tabellen

    Vergelijkt opslagformaten TextFile, SequenceFile, ORC en Parquet. De formatkeuze heeft directe invloed op de querysnelheid en opslagefficiëntie.

  • Les 4 • Beheerde versus externe tabellen

    Onderscheidt beheerde tabellen (Hive-eigen gegevens) van externe tabellen (gebruiker-eigen gegevens). De juiste keuze voorkomt onbedoeld gegevensverlies.

  • Les 5 • Bucketen en clusteren

    Introduceert bucketing als aanvulling op partitionering voor een uniforme gegevensverdeling. Gebuckete tabellen maken efficiënte sampling en join-optimalisatie mogelijk.

Hoofdstuk 4Bekijk details

Gegevens laden, invoegen en beheren

  • Les 1 • Gegevens laden uit bestanden

    Behandelt LOAD DATA LOCAL en LOAD DATA vanaf HDFS-paden. Bestandsgebaseerd laden is het meest voorkomende eerste opnamepatroon in Hive-workflows.

  • Les 2 • ACID-transacties en CRUD-bewerkingen

    Legt de ACID-ondersteuning van Hive uit die UPDATE en DELETE op ORC-tabellen mogelijk maakt. ACID-bewerkingen vereisen specifieke configuratie en tabeleigenschappen.

  • Les 3 • INSERT- en INSERT OVERWRITE-patronen

    Leert INSERT INTO en INSERT OVERWRITE voor querygestuurde gegevenspopulatie. Deze patronen ondersteunen ETL-pijplijnen die volledig binnen HiveQL zijn gebouwd.

  • Les 4 • Gegevens exporteren en archiveren

    Behandelt INSERT OVERWRITE DIRECTORY en de EXPORT-/IMPORT-opdrachten. Gegevensexport ondersteunt downstream-consumptie en cross-cluster-migratie.

Hoofdstuk 5Bekijk details

Joins, unions en geavanceerd query's uitvoeren

  • Les 1 • Skew-joins en omgaan met gegevensscheefheid

    Behandelt joinscheefheid veroorzaakt door veelvoorkomende sleutelwaarden die reducers overbelasten. Skew-join-optimalisatie verdeelt hete sleutels over meerdere taken.

  • Les 2 • Jointypen en -syntaxis

    Behandelt INNER-, LEFT-, RIGHT-, FULL OUTER- en CROSS-joins met HiveQL-syntaxis. Inzicht in join-semantiek voorkomt onjuiste resultaatsets.

  • Les 3 • UNION, INTERSECT en EXCEPT

    Leert setbewerkingen voor het combineren en vergelijken van resultaatsets van verschillende query's. Deze bewerkingen ondersteunen patronen voor deduplicatie en verschilanalyse.

  • Les 4 • Map-side- en broadcast-joins

    Legt map-side-joins uit met de MAPJOIN-hint voor optimalisatie van kleine tabellen. Broadcast-joins elimineren de shuffle-overhead bij joins tussen grote en kleine tabellen.

  • Les 5 • Vensterfuncties en analyses

    Introduceert OVER, PARTITION BY en ORDER BY voor rangschikking en lopende aggregaties. Vensterfuncties maken geavanceerde analyses mogelijk zonder de rijgranulariteit te verliezen.

Hoofdstuk 6Bekijk details

Technieken voor query-optimalisatie

  • Les 1 • Het query-uitvoeringsplan begrijpen

    Gebruikt EXPLAIN en EXPLAIN EXTENDED om MapReduce- en Tez-uitvoeringsplannen te interpreteren. Het lezen van plannen is de vereiste vaardigheid voor alle optimalisatiebeslissingen.

  • Les 2 • Tez-uitvoeringsengine afstemmen

    Configureert Tez DAG-uitvoering voor verminderde latentie in vergelijking met MapReduce. Tez is de aanbevolen engine voor interactieve en iteratieve Hive-workloads.

  • Les 3 • Partitiepruning en predicate pushdown

    Zorgt ervoor dat query's alleen relevante partities scannen en filters zo vroeg mogelijk toepassen. Deze technieken verminderen I/O, wat de dominante kostenpost is in Hive-query's.

  • Les 4 • Optimalisatie van bestandsformaat en compressie

    Selecteer ORC en Parquet met geschikte compressie-codecs om de scantijd te minimaliseren. Compressie verlaagt zowel de opslagkosten als de netwerk-I/O tijdens query-uitvoering.

  • Les 5 • Vectorisatie en de Cost-Based Optimizer

    Schakelt gevectoriseerde query-uitvoering en de Cost-Based Optimizer (CBO) in voor automatische planverbetering. Beide vereisen het verzamelen van statistieken om correct te functioneren.

Hoofdstuk 7Bekijk details

Door de gebruiker gedefinieerde functies en uitbreidbaarheid

  • Les 1 • Door de gebruiker gedefinieerde tabelfuncties

    Bouwt UDTF's die meerdere rijen uit één invoerrij emitteren met behulp van de UDTF-interface. UDTF's ondersteunen het uiteenrafelen van geneste structuren en aangepaste rijgeneratie.

  • Les 2 • Door de gebruiker gedefinieerde aggregatiefuncties

    Implementeert UDAF's met behulp van de UDAF- en GenericUDAF-interfaces voor aangepaste aggregaties. UDAF's werken over reducergroepen heen en vereisen buffermanagement.

  • Les 3 • Grondbeginselen van UDF-ontwikkeling

    Behandelt de UDF-basisklasse, de evaluate-methode en JAR-verpakking voor eenvoudige scalaire functies. UDF's vullen gaten waar ingebouwde functies ontoereikend zijn.

  • Les 4 • Python- en scriptgebaseerde transformaties

    Gebruikt TRANSFORM en streaming scripts om Python- of shell-logica binnen HiveQL toe te passen. Scripttransformaties maken snelle prototyping mogelijk zonder Java-compilatie.

Hoofdstuk 8Bekijk details

Hive in productie: beveiliging en governance

  • Les 1 • Metastore-beheer en hoge beschikbaarheid

    Configureert een externe metastore met een relationele backend en een hoge-beschikbaarheidsopstelling. Betrouwbaarheid van de metastore is cruciaal voor ononderbroken Hive-service in productie.

  • Les 2 • Autorisatiemodellen: SQL-standaarden en Ranger

    Vergelijkt de SQL-standaardautorisatie van Hive met Apache Ranger-beleidsgestuurde controle. Fijnmazige autorisatie dwingt het principe van minimale privileges af op kolomniveau.

  • Les 3 • Authenticatie en Kerberos-integratie

    Configureert op Kerberos gebaseerde authenticatie voor HiveServer2 en clientverbindingen. Authenticatie voorkomt onbevoegde toegang tot gevoelige gegevensactiva.

  • Les 4 • Datamaskering en encryptie

    Past dynamisch datamaskeringsbeleid en HDFS-encryptiezones toe om gevoelige kolommen te beschermen. Maskering maakt analyses op gevoelige gegevens mogelijk zonder onbewerkte waarden bloot te geven.

  • Les 5 • Auditing en compliance-logboekregistratie

    Schakelt query-auditlogboeken in via HiveServer2 en Apache Ranger-audit trails. Auditlogboeken voldoen aan wettelijke nalevingsvereisten voor het bijhouden van gegevenstoegang.

Certificering

Jouw geldig certificaat van voltooiing

Deze cursus is voor jou:

  • Data-analisten die klaar zijn om hun vaardigheden uit te breiden voorbij spreadsheets en SQL.

  • Software-engineers die overstappen naar rollen in big data en gedistribueerde systemen.

  • ETL-ontwikkelaars die pipelines willen moderniseren met Hadoop-gebaseerde tooling.

  • Databasebeheerders die columnair opslag en grootschalige query-optimalisatie verkennen.

  • Business intelligence-professionals wier datasets de relationele databases zijn ontgroeid.

  • Cloud-engineers die belast zijn met het bouwen of migreren van datawarehouse-infrastructuur.

Wat onze studenten zeggen

Jullie lessen zijn perfect. Ik heb het jaarpakket aangeschaft en heb eindelijk de mogelijkheid om verschillende onderwerpen die mij interesseren te volgen zonder van platform te hoeven wisselen... bedankt voor alles wat jullie doen, ik heb jullie al aan anderen aanbevolen...
Giulio Carlo
Giulio CarloStudent Digitale Marketing
Ik vind het fijn hoe de lessen direct ter zake zijn en hoe ik tussen hoofdstukken kan wisselen en content kan overslaan die ik niet nodig heb.
Mariana Ferres
Mariana FerresStudent Fotografie
Ik vind de content en de manier van presenteren en transcriptie van video's geweldig, wat het proces versnelt!
Luciana Alvarenga
Luciana AlvarengaStudent Nageldesign
Het platform is snel en eenvoudig te gebruiken. De diversiteit aan content en de aanvullende video's helpen enorm bij het leren.
André Felipe
André FelipeStudent Prompt Engineering

Belangrijkste opleidingen

FAQ

Wie is Dedika?

Is het certificaat geldig in Nederland?

Zijn de cursussen gratis?

Wat is de studielast van de cursus?

Hoe zien de cursussen eruit?

Hoe werken de cursussen?

Wat is de duur van de cursussen?

Wat zijn de kosten of prijzen van de cursussen?

Wat is een EAD- of online cursus en hoe werkt het?

PDF-cursus