Czym jest ACID? Co oznacza każda litera? Jak to się odnosi do transakcji?
Data Engineer
Czy znasz format Avro?
Opowiedz o relacyjnych bazach danych ogólnie — czym one są?
Kiedy nie potrzebujemy przechowywania danych?
Czym jest typowanie kaczki (duck typing)?
Wspomniałeś o procesach Docker, czy możesz powiedzieć więcej o tym, jak to u was zorganizowane?
Czy masz doświadczenie z obrazami Docker, tworzeniem środowiska na maszynie wirtualnej?
Jakie są ograniczenia w korzystaniu z tablic haszujących?
Jak zorganizowany jest Twój QA (kontrola jakości danych)?
Czy masz doświadczenie z Table Engine Join w ClickHouse?
Opowiedz o swoim doświadczeniu z rozproszonymi bazami danych (Greenplum, ClickHouse)?
Jakie są rodzaje połączeń fizycznych (metody łączenia)?
Czym jest plan zapytań? Do czego są potrzebne?
Czy można wymyślić coś innego zamiast zwykłego CTE, biorąc pod uwagę, że filtrowanie nadal odbywa się w pamięci na całej tabeli?
Załóżmy, że Data Vault nie jest dostępny i trzeba połączyć dwie szerokie tabele. Jak byś to zoptymalizował w Greenplum? A gdyby to było w ClickHouse?
Jaka jest różnica między refaktoryzacją a optymalizacją?
Co obecnie nie podoba ci się w twojej pracy?
W jakim środowisku uruchomiono Spark?
Czy masz doświadczenie w pracy z silnikami takimi jak Trino lub z formatami tabelarycznymi (Iceberg, Parquet) w Spark?
Jaka jest różnica między == a is w Pythonie?