Ce sunt indicii în bazele de date, la ce servesc și care este structura lor internă?
Data Engineer
Vorbește despre experiența ta de muncă în ultimele locuri, ce proiecte, ce tehnologie?
Care este diferența dintre UNION și UNION ALL? Care sunt condițiile care trebuie îndeplinite?
Ce grupuri de operatori SQL cunoști? La ce aparțin?
Ce este optimizatorul Catalyst în Spark și ce exemple specifice de optimizări face (de exemplu, predicate pushdown)?
Cum funcționează Hash Join?
Cum verificați corectitudinea datelor în timpul traducerii unui pipeline de la SAS la DBT?
Ce este normalizarea? La ce formă lucrăm în principal?
De ce apar blocajele (deadlock) și ce mecanism din bazele de date răspunde de coerența datelor în timpul interogărilor paralele?
De ce ați ales în mod special DBT? Ce avantaje și dezavantaje vedeți în acest framework?
Verificări ale calității datelor — în ce etapă, ce verificări, ce se întâmplă cu datele nevalide?
Ați lucrat cu incidente de calitate a datelor?
Povestește despre o sarcină interesantă din companie în ultimele 2,5 ani, de exemplu legată de ClickHouse.
Care sunt caracteristicile și diferențele dintre Set și List în Python? În afară de performanță, ce alte caracteristici există?
Cum funcționează Merge Join (îmbinare cu sortare)?
Îți place mai mult să lucrezi individual ca expert sau în echipa de dezvoltatori?
Ce formate de distribuție există în Greenplum în afară de BY column și RANDOMLY?
Enumerați secvența de operații într-o interogare SQL cu SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT, de la prima la ultima.
Ce tipuri de conexiuni fizice între tabele există (Hash Join, Merge Join, Nested Loop)?
Dacă unești tranzacțiile cu clienții după client_id și date_start (fără BETWEEN), ce va fi capturat în rezultat?