Czym są indeksy w bazach danych, do czego służą i jaka jest ich wewnętrzna struktura?
Data Engineer
Opowiedz o swoim doświadczeniu w ostatnich miejscach pracy, jakie projekty, jaki stos technologiczny?
Jaka jest różnica między UNION a UNION ALL? Jakie warunki muszą być spełnione?
Jakie grupy operatorów SQL znasz? Do czego się one odnoszą?
Czym jest optymalizator Catalyst w Spark i jakie konkretne przykłady optymalizacji wykonuje (np. predicate pushdown)?
Jak działa Hash Join?
Jak sprawdzasz poprawność danych podczas tłumaczenia pipeline'a z SAS na DBT?
Dlaczego występują deadlocki i jaki mechanizm w bazach danych odpowiada za spójność danych podczas zapytań równoległych?
Czym jest normalizacja? Na jakiej formie głównie pracujemy?
Dlaczego wybraliście akurat DBT? Jakie widzicie zalety i wady tego frameworka?
Na jakim etapie, jakie kontrole są przeprowadzane i co się dzieje z nieprawidłowymi danymi podczas kontroli jakości danych (Data Quality)?
Czy pracowałeś z incydentami jakości danych?
Opowiedz o interesującym zadaniu w firmie w ciągu ostatnich 2,5 roku, na przykład związanym z ClickHouse.
Jakie są cechy i różnice między Set a List w Pythonie? Oprócz wydajności, jakie inne cechy mają?
Jak działa Merge Join (łączenie z sortowaniem)?
Wolisz pracować jako ekspert indywidualnie czy w zespole programistów?
Jakie są formaty dystrybucji w Greenplum oprócz BY column i RANDOMLY?
Wypisz kolejność wykonywania operacji w zapytaniu SQL z SELECT, FROM, WHERE, GROUP BY, HAVING, ORDER BY, LIMIT od pierwszej do ostatniej.
Jakie rodzaje fizycznego łączenia tabel istnieją (Hash Join, Merge Join, Nested Loop)?
Co zostanie przechwycone jako wynik, jeśli połączysz transakcje z klientami według client_id i date_start (bez BETWEEN)?