Čo sú indexy v databázach, na čo slúžia a aká je ich vnútorná štruktúra?
Data Engineer
Povedz mi o svojej pracovnej skúsenosti na posledných miestach, aké projekty, aký stack?
Aký je rozdiel medzi UNION a UNION ALL? Aké podmienky musia byť splnené?
Aké skupiny SQL operátorov poznáš? Čo k nim patrí?
Pracovali ste s incidentmi kvality údajov?
Prečo vznikajú deadlocky a aký mechanizmus v databázach je zodpovedný za konzistentnosť údajov pri paralelných dopytoch?
Ako funguje Hash Join?
Čo je Catalyst optimalizátor v Spark a aké konkrétne optimalizácie vykonáva (napríklad predicate pushdown)?
Ako overujete správnosť údajov pri preklade pipeline z SAS do DBT?
Prečo ste si vybrali práve DBT? Aké výhody a nevýhody vidíte v tomto rámci?
Čo je normalizácia? Na ktorej forme v podstate pracujeme?
Povedz o zaujímavej úlohe v spoločnosti za posledných 2,5 roka, napríklad súvisiacej s ClickHouse.
Kontroly kvality údajov — v akej fáze, aké kontroly, čo sa deje s neplatnými údajmi?
Aké sú vlastnosti a rozdiely medzi Set a List v Pythone? Okrem výkonu, aké ďalšie vlastnosti existujú?
Aké formáty distribúcie sú v Greenplum okrem BY column a RANDOMLY?
Ako funguje Merge Join (spajanie s triedením)?
Radšej pracujete ako expert individuálne alebo v tíme vývojárov?
Máme tabuľku zákazníkov (id, meno, adresa atď.), produkty (id, názov atď.), pohyb tovaru (tu máme id zákazníka, tovar, dátum, množstvo, suma), je potrebné zistiť, aké produkty boli predané 1. januára, iba tie jedinečné, a tiež zobraziť meno kupujúceho a...
Uveďte poradové poradie vykonávania operácií v SQL s SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT od prvej po poslednú.
Aké druhy fyzického spojenia tabuliek existujú (Hash Join, Merge Join, Nested Loop)?