Cum funcționează optimizatorul de interogări în Oracle, la ce se uită și la ce clasă aparține?
Data Engineer
Care este scopul împărțirii datelor în blocuri în HDFS?
Cum lucrai cu Impala?
Cu ce se deosebește HDFS de sistemele de fișiere distribuite obișnuite?
Cum funcționează MapReduce, în special etapa Reduce?
Ce este YARN și la ce folosește?
Cum ați lucrat cu CI/CD?
Cum ați încărcat datele din S3 în Greenplum?
Ce este shuffle în Spark și de ce este important să-l minimizăm?
Cum se vizualizează planul de execuție al unei interogări în Oracle? În ce constă diferența dintre EXPLAIN PLAN și EXPLAIN ANALYZE?
Vorbiți despre utilizarea procedurilor PL/SQL în munca dvs.
Ce este o alăturare broadcast în Spark?
Ai experiență în optimizarea sarcinilor Spark? Poți oferi un exemplu concret?
Ați fost nevoit vreodată să scrieți pachete în Oracle?
Ai lucrat cu încărcări incrementale și complete? Cum ai gestionat duplicatele?
Care este diferența dintre RANK și DENSE_RANK?
Ce este Hive și cum se diferențiază de bazele de date relaționale tradiționale?
Care este avantajul stocării pe coloană față de stocarea pe rând?
Cum se citește un fișier din HDFS, de exemplu Parquet — integral sau pe blocuri?
Vorbiți despre partiționare în Oracle: la ce se folosește și ce tipuri există?