Môžete vysvetliť partícionovanie v Oracle: na čo sa používa a aké druhy existujú?
Data Engineer
Ako sa číta súbor z HDFS, napríklad Parquet — celý alebo po blokoch?
Zodpovedá plán vykonávania z EXPLAIN tomu, čo sa skutočne vykonáva?
Čo sú pohľady (VIEW) a materializované pohľady (MATERIALIZED VIEW) v Oracle? Ako sa aktualizujú údaje v materializovanom pohľade?
Kedy je možné použiť rodinu formátov CSV?
Aké ďalšie formáty súborov, okrem Parquet, dobre fungujú s Hadoop a Hive?
Je možné si pred vykonaním dotazu v Hive pozrieť schému tabuľky?
Prečo sa oddelujú pohľady (VIEW) a tabuľky? Na čo slúžia pohľady?
Ako zistiť skutočný plán vykonávania dotazu v Oracle?
Ako vaše skúsenosti zodpovedajú zodpovednostiam na pracovnej pozícii: sprievod a analýza procesov načítania, monitorovanie a odhaľovanie anomálií, testovanie a nasadzovanie vylepšení do produkcie, podpora druhej línie, kontrola technickej dokumentácie?
Čo sú to lenivé operácie v Spark a na čo slúžia?
Povedz mi o svojom predchádzajúcom projekte, aké boli tvoje povinnosti?
Museli ste pracovať s Oracle Data Integrator (ODI)?
Môžeš si spomenúť na svoju skúsenosť s optimalizáciou dopytov? Ako si konal, analyzoval?
Aké sú výhody a nevýhody distribuovaných systémov databáz?
Aká bola vaša architektúra na projekte? DWH alebo niečo iné?
V Hive bol pomalý analytický dopyt. Ako pochopiť, čo sa stalo a ako ho opraviť?
Pracoval si s dávkovým nahrávaním alebo streamovaním?
Pracoval si s oknovými funkciami? Aké druhy oknových funkcií poznáš?
Aký je rozdiel medzi viacvláknovým spracovaním a viacprocesovým spracovaním? Na aké úlohy používať vlákna a na aké procesy?