Data Engineer
Czym jest normalizacja i denormalizacja, kiedy są potrzebne?
Podaj przykład typowego zadania związane z pisaniem DAG w Airflow.
Co się stało i jak odzyskać pracę?
Czym jest ACID? Co oznacza każda litera? Jak to się odnosi do transakcji?
Oceń ostateczne rozwiązanie pod względem czasu i pamięci.
Na ile realistyczne są plany firmy dotyczące budowy systemu zbierania, normalizacji i analizy danych?
Czym różni się EXPLAIN ANALYZE od zwykłego EXPLAIN? Dlaczego nie zaleca się uruchamiania go na zapytaniach DELETE/UPDATE?
Wyjaśnij leniwe i natychmiastowe obliczenia w Spark.
W Hive wystąpiło wolne zapytanie analityczne. Jak zrozumieć, co się z nim stało i jak je naprawić?
Które zasoby są najbardziej wykorzystywane podczas Nested Loop Join?
Czy możesz opowiedzieć, co ostatecznie tutaj uzyskamy? Należy skomentować każdy krok, jak to działa.
Istnieje tabela T1 (10 wierszy) i tabela T2 (5 wierszy), obie z polem ID. Ile wierszy może maksymalnie i minimalnie być na wyjściu przy INNER JOIN i LEFT JOIN tych tabel?
Co sprawdzić, jeśli logi się nie otwierają (błąd 403)?
Na jakim etapie, jakie kontrole są przeprowadzane i co się dzieje z nieprawidłowymi danymi podczas kontroli jakości danych (Data Quality)?
Data Vault to wygodne narzędzie, ale jest za dużo obiektów. Czy możesz wyjaśnić różnicę między hubami, linkami i satelitami?
Z czego zazwyczaj składają się logi zadań Airflow?
[imię] poprawił błędy i styl w tekście: «Cześć! Jestem [imię], wcześniej prosiłeś o przejście na Telegram» — na „ty”, ale z szacunkiem
Jak dodać ruchomą średnią sumy zamówień za bieżący i dwa poprzednie dni na użytkownika?
Czym jest shuffle w Spark i do czego jest potrzebny?
W jakim zespole i pod czyim kierownictwem czujesz się najbardziej komfortowo?