Jak dobrze znasz Linux/Docker?
Data Engineer
Czym jest shuffle w Spark i do czego jest potrzebny?
Jak zarządzać shuffle w Spark (partycyjność, broadcast join itp.)?
Co wnosi format Iceberg w porównaniu do zwykłego Parquet?
Czy znasz wyrażenia tabeli wspólnej (CTE)? Podaj przykład użycia.
Czym jest statystyka w kontekście systemów zarządzania bazami danych i optymalizacji zapytań?
Jak znaleźć podłańcuch w konkretnej kolumnie pliku logu w Linuxie (np. data w trzeciej kolumnie)?
[imię] opowiedział o swoim doświadczeniu z różnymi systemami zarządzania bazami danych, jak głęboko musiał zagłębiać się w optymalizację i szczegóły wewnętrzne.
Szczegółowo opisz algorytm przechwytywania inkrementu ze źródła, aby nic nie zostało utracone przy zmianie częstotliwości ładowania.
Jak zorganizować odczyt tej samej wiadomości z Kafka przez kilku różnych konsumentów (fan-out)?
Jak rozwiązać problem, gdy proces odczytu może zobaczyć pośredni (niezgodny) stan tabeli podczas wieloetapowego ETL (delete+insert) w Iceberg?
Jak porównać tabelę źródłową ("na żywo") i tabelę docelową, jeśli źródło jest stale zmieniane?
Czym jest "martwa krotka" (dead tuple)?
Jak są powiązane partycje Spark i partycje w tabelach (np. w Iceberg)?
Opowiedz o najlepszych praktykach stosowania indeksów – kiedy i jak często ich używać.
Czym jest Spark JDBC i jak efektywnie załadować dużą tabelę przez niego?
Jak wykryć odchylenie danych (data skew) w Spark?
Czym jest dziennik transakcji (WAL) w systemie zarządzania bazami danych i do czego służy?
Czy użyto metody porównywania hashy rekordów do obliczenia różnicy między źródłem a tabelą docelową?
Do czego służą cache i persist w Spark?