Data Engineer
Jakie są Twoje oczekiwania finansowe?
Czym jest idempotentność DAG/zadania w Airflow?
Dlaczego wybraliście akurat DBT? Jakie widzicie zalety i wady tego frameworka?
Dane są dwie tabele t1 i t2. Zadaniem jest wypisanie wszystkich rodzajów joinów, które znasz, oraz wynik zapytania select * from t1 <join> t2 on t1.t = t2.t dla każdego z nich. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null cross 1 1 - null null - INNER JOIN [phone] LEFT JOIN 1 - 1 2 - NULL 4 - NULL NULL - NULL RIGHT JOIN [phone] NULL - 3 NULL - NULL NULL - NULL FULL JOIN [phone] - NULL 4 - NULL NULL - 3 null - NULL null - NULL null - NULL
Jakie problemy może wykryć śledzenie?
Jak może dojść do wstrzyknięcia SQL przez pole wprowadzania daty?
Czym jest wstrzyknięcie SQL?
Jak działa partycjonowanie w Hive i jak jest ono fizycznie reprezentowane w systemie plików?
Czym jest YARN i do czego służy?
Czy masz doświadczenie w pracy z biblioteką Langchain? Jakie zadania rozwiązałeś za jej pomocą?
Jakie rodzaje fizycznego łączenia tabel istnieją (Hash Join, Merge Join, Nested Loop)?
Jakie są rodzaje połączeń fizycznych (metody łączenia)?
Do czego służą indeksy, jakie są ich zalety i wady?
Jakie są ograniczenia w korzystaniu z tablic haszujących?
Co robisz, gdy napotkasz problem w pipeline produkcyjnym?
Jakie są wady architektury MPP w Greenplum?
Dana jest łańcuch zer i jedynek. Należy napisać funkcję func(), która zwróci maksymalną liczbę kolejnych jedynek. Na przykład: func("010111011") -> 3
Jakie metody usuwania danych istnieją w ClickHouse?
Czy śledzenie pokazuje tylko żądania REST czy coś jeszcze?
Jakimi typami tabel w Greenplum się posługiwałeś? W jakich przypadkach używałeś heap, a w jakich Append-Optimized?