Data Engineer
Jakie fizyczne algorytmy JOIN działają w bazach danych?
Opowiedz o swoim poziomie znajomości Pythona: czego używałeś, jak głęboko znasz programowanie obiektowe
Jak działa Hash Join?
Jak zarządzać shuffle w Spark (partycyjność, broadcast join itp.)?
Czy było dodatkowe logowanie oprócz logów Airflow?
Czy zarządzałeś Airflow, czy tylko pracowałeś jako programista?
Czy znasz UDF (Funkcje zdefiniowane przez użytkownika) w ClickHouse, czy pracowałeś z nimi?
Czy konfigurowałeś tagi w S3 na bucketach lub obiektach?
Czy pisałeś testy jednostkowe? Czy masz takie doświadczenie?
Opowiedz mi o swoim poprzednim projekcie, jakie miałeś obowiązki?
Mamy ORDER BY według liczby zamówień, i mamy dwa zamówienia po 5, jeszcze dwa po 3. Jak zachowają się RANK() i DENSE_RANK()?
Jakim poleceniem z katalogu głównego projektu należy zaktualizować submoduł docs/ do najnowszej wersji z repozytorium zdalnego i przygotować tę zmianę do zatwierdzenia? git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "Aktualizacja" git submodule update --init docs/
Czy masz doświadczenie w pisaniu dokumentacji?
Czym różni się format przechowywania Parquet od CSV?
Jakie masz doświadczenie i wiedzę na temat budowania pipeline'ów do obliczania witryn (przetwarzanie danych)?
Jeśli ustawimy warunek filtrowania po dacie transakcji w WHERE (po LEFT JOIN), czy to ograniczy wynik w pierwszej tabeli (klientach)?
Czy masz doświadczenie w konfigurowaniu pipeline w CI/CD, na przykład GitLab?
Tworzysz tabelę audit_logs, w której musisz przechowywać datę i dokładny czas z strefą czasową. Jaki jest najbardziej odpowiedni typ danych? czas z strefą czasową interwał znacznik czasu z strefą czasową data znacznik czasu bez strefy czasowej
Opowiedz o najlepszych praktykach stosowania indeksów – kiedy i jak często ich używać.
Przy streamingu Iceberg działał, słyszałeś? To jest śmietnikowe przechowywanie plików.