Data Engineer
Czy używałeś Bridge i tabel PIT w Data Vault? Podaj przykład i wyjaśnij ich cel.
Opowiedz o zadaniu związanym z konfiguracją replikacji, które rozwiązałeś.
Jaka jest wada UDF w Spark i jaka jest ich minus?
Jak Spark określa, że tabela jest wystarczająco 'mała' do dołączenia broadcast (górna granica)?
W PostgreSQL nagłówek wersji wiersza zawiera parametr xmax. Jaka jest jego rola w zarządzaniu transakcjami? - Do tworzenia unikalnego identyfikatora wiersza w tabeli - Do sprawdzania widoczności wiersza przez inne transakcje - Do oznaczania numeru transakcji, która usunęła lub zaktualizowała wiersz - Do blokowania wiersza przed jednoczesnymi zmianami przez wiele transakcji - Do wskazywania maksymalnej wartości, którą można zapisać w kolumnie numerycznej
Opowiedz ogólnie o swoim doświadczeniu i czego się uczyłeś.
Co jest dla ciebie ważne w nowym projekcie, nowym zespole lub firmie?
Jakie procesy są uruchamiane, gdy usuwamy lub zmieniamy rekordy w ClickHouse?
Czym jest VACUUM w PostgreSQL? Jakie są jego rodzaje? Czy można go używać na produkcji?
Czym jest LEFT SEMI JOIN i LEFT ANTI JOIN w Spark SQL, czy miałeś kiedyś okazję ich używać?
Czym różnią się polecenia docker run i docker exec?
Utworzono specjalną sekwencję o nazwie even_sequence, generującą wyłącznie liczby parzyste. Co należy wpisać w miejsce [...], aby w przypadku braku podania wartości even_column podczas wstawiania, wartość ta była pobierana z even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
Jaka jest złożoność algorytmiczna pobierania elementu po kluczu z słownika (dict) w Pythonie?
Jak wybrać odpowiedni klucz shardowania do równomiernego rozkładu danych?
Jak postąpiłbyś z łańcuchem Materialized View przez pośrednią tabelę ReplacingMergeTree, aby poprawnie wypełnić dane już istniejące przed uruchomieniem nowej MV?
Czym jest widok materializowany i czym różni się od zwykłego widoku?
Jak sprawdzasz poprawność danych podczas tłumaczenia pipeline'a z SAS na DBT?
Co obecnie nie podoba ci się w twojej pracy?
Jaka jest różnica między refaktoryzacją a optymalizacją?
Kiedy nie potrzebujemy przechowywania danych?