Data Engineer
Oprócz API, jakimi innymi metodami i protokołami pracowałeś z źródłami danych?
Opowiedz o swoim rozumieniu jakości danych — czy masz doświadczenie w pracy w tym obszarze?
Jakie agenty i modele są używane w Twoim korporacyjnym rozwiązaniu AI? Czy pisze za Ciebie kod?
Do czego służą cache i persist w Spark?
Jak uruchamialiście DAG-i: według cron, zestawów danych, wyzwalaczy czy zależności?
importuj clickhouse_driver from airflow.hooks.base import * def get_clickhouse_client(): conn = BaseHook.get_connection("clickhouse_default") return clickhouse_driver.Client( host=conn.host, port=conn.port, user=conn.login, password=conn.password, database=conn.schema )
Jakie parametry Spark JDBC zostały użyte do równoległego odczytu?
Czym jest CROSS JOIN i jaki jest wynik jego zastosowania?
W jakim kierunku byłoby interesujące się rozwijać: witryny, rozwój, analiza, może AI?
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [telefon] null null 5 WYBIERZ a.num JAKO a_num, b.num JAKO b_num Z t1 a LEWE POŁĄCZENIE t2 b ON a.num = b.num;
Jakie nieoczywiste problemy mogą wystąpić podczas ładowania dużych tabel (oprócz wydajności)?
Funkcja okienkowa SUM() OVER (PARTITION BY user_id) — w jednym przypadku dodajemy ORDER BY data zakupu, w drugim nie. Jaka jest różnica?
Do czego w ogóle potrzebowałeś Data Vault?
Jaki typ przechowywania ma Parquet: wierszowy czy kolumnowy?
Opowiedz o zadaniu związanym z konfiguracją replikacji, które rozwiązałeś.
CREATE TABLE datamarts.daily_revenue_per_country ON CLUSTER cluster_4x2 ( event_date Date, country String, total_revenue Float64 ) ENGINE = MergeTree() PARTITION BY toYYYYMM(event_date) ORDER BY (event_date);
Opowiedz mi o procesach CI/CD, zmianach w bazie danych, wersjonowaniu i migracjach schematu (ewolucja schematu).
Co cię przyciąga do branży travel? Może sam lubisz podróżować, albo travel-tech jakoś cię zainteresował?
Opowiedz o swoim doświadczeniu z rozproszonymi bazami danych (Greenplum, ClickHouse)?
Zaproponuj rozwiązanie regularnego inkrementalnego ładowania dużej tabeli z elastyczną (zmienną) częstotliwością aktualizacji z Postgres do Data Lake.