Data Engineer
Ispričajte više o neravnoteži podataka između shardova: kako je određena i kako je korišćena odgovarajuća funkcija/mehanizam?
Ispričaj mi o svom razumijevanju kvaliteta podataka — imaš li iskustva s tim područjem?
Ispričajte o najtežem ili najzanimljivijem zadatku koji ste morali riješiti
Koji red ili tip kompresije se koristi u Parquet?
U kom redu se obavljaju osnovne operacije u SQL-u: SELECT, FROM itd.?
Kako su podaci iz spoljne tabele učitani u ciljne tabele?
Šta je vitrína podataka?
Da li imate pitanja o timu i ulozi?
Kako spojiti dve tabele u SQL?
Ispričajte o sebi, gde ste radili, čime ste se bavili, koje su bile zanimljive zadatke i neuspehi.
Kako obično radite sa Git-om u timu? I šta je Merge Request?
Naša tema je veoma strukturirana, u obliku stabla, podaci su sirovi — kako ih obraditi?
Šta je CDC i imate li iskustva sa tim?
Navedite poznate vam SQL funkcije prozora.
Šta je dekorator u Pythonu?
Šta je Spark JDBC i kako efikasno učitati veliku tabelu putem njega?
Čemu služi ograničenje spoljnog ključa i kakvog je smisla ograničenje pri brisanju/izmeni kada postoje zavisni zapisi (logički)?
Kako izbeći/ukloniti pristrasnost podataka u Spark-u?
Da li si radio sa anotacijama tipova? Znaš li šta je to?
Kako je organizovan vaš QA (provera kvaliteta podataka)?