Jak funguje optimalizátor dotazů v Oracle, na co se dívá a do jaké třídy patří?
Data Engineer
Jaký je smysl rozdělování dat na bloky v HDFS?
Jak jste pracovali s Impala?
V čem se HDFS liší od běžných distribuovaných souborových systémů?
Jak funguje MapReduce, zejména fáze Reduce?
Co je YARN a k čemu slouží?
Jak jste pracovali s CI/CD?
Jak jste načítali data z S3 do Greenplum?
Co je shuffle v Spark a proč je důležité ho minimalizovat?
Jak zobrazit plán provádění dotazu v Oracle? Čím se liší EXPLAIN PLAN od EXPLAIN ANALYZE?
Povězte nám o používání PL/SQL procedur ve vaší práci.
Co je to broadcast join v Spark?
Máte zkušenosti s optimalizací úloh Spark? Můžete uvést konkrétní příklad?
Museli jste někdy psát balíčky v Oracle?
Pracoval jste s inkrementálními a úplnými načteními? Jak jste se vypořádali s duplicitami?
Jak se čte soubor z HDFS, například Parquet — celý nebo po blocích?
Čím se liší RANK od DENSE_RANK?
Jaké je výhoda sloupcového ukládání oproti řádkovému?
Můžete vysvětlit partitioning v Oracle: k čemu se používá a jaké typy existují?
Jak funguje rozdělení v Hive a jak je fyzicky znázorněno v souborovém systému?