Data Engineer
Šta je normalizacija i denormalizacija, kada su potrebne?
Navedite primer tipičnog zadatka za pisanje DAG u Airflow.
Šta se dogodilo i kako povratiti rad?
Šta je ACID? Šta znači svako slovo? Kako se to odnosi na transakcije?
Procijenite završno rješenje u pogledu vremena i memorije.
Koliko su realistični planovi kompanije za izgradnju sistema za prikupljanje, normalizaciju i analizu podataka?
Koja je razlika između EXPLAIN ANALYZE i običnog EXPLAIN? Zašto nije preporučljivo pokretati ga na DELETE/UPDATE upitima?
Objasnite lenjive i odmahene izračune u Spark-u.
U Hive-u je bio spor analitički upit. Kako shvatiti šta se desilo i kako ga popraviti?
Koji resurs se najviše troši kod Nested Loop Join?
Можеш ли да објасниш шта ћемо добити на крају овде? Потребно је коментарисати сваки корак, како то функционише.
Postoje tabela T1 (10 redova) i tabela T2 (5 redova), obe sa poljem ID. Koliko redova može biti maksimalno i minimalno na izlazu pri INNER JOIN i LEFT JOIN ovih tabela?
Šta treba proveriti ako se logovi ne otvaraju (greška 403)?
Na kojoj fazi, koje provere se vrše i šta se dešava sa nevažećim podacima tokom provere kvaliteta podataka (Data Quality)?
Data Vault je zgodna stvar, ali objekata je previše. Možete li objasniti razliku između hubova, linkova i satelita?
Od čega se obično sastoje logovi zadataka Airflow?
[ime] je ispravio greške i stil u tekstu: «Zdravo! Ja sam [ime], ranije si tražio da pređeš na Telegram» — na „ti“, ali s poštovanjem
Kako dodati pomični prosek sume narudžbina za tekući i prethodna dva dana po korisniku?
Šta je shuffle u Spark-u i čemu služi?
У којем тиму и под којим руководством вам је најудобније да радите?