Opowiedz o zadaniu związanym z konfiguracją replikacji, które rozwiązałeś.
Data Engineer
W jakich przypadkach stosuje się normalizację, a w jakich denormalizację?
Jak uniknąć/usunąć stronniczość danych w Spark?
Jaki jest algorytm diagnostyczny i co robić, jeśli zapytanie nadal jest wolne po dodaniu kilku indeksów?
Czym jest normalizacja i model ER, do czego służą?
Opowiedz o podstawowych koncepcjach Kafka (grupa konsumentów, partycje, tematy).
Jakie są typowe przyczyny tego, że zapytanie w relacyjnej bazie danych działa wolno?
Jakie nieoczywiste problemy mogą wystąpić podczas ładowania dużych tabel (oprócz wydajności)?
Zaproponuj rozwiązanie regularnego inkrementalnego ładowania dużej tabeli z elastyczną (zmienną) częstotliwością aktualizacji z Postgres do Data Lake.
Jak są powiązane sortowanie wewnątrz funkcji okna i końcowe sortowanie ORDER BY w zapytaniu?
Jak zarządzać zasobami aplikacji Spark, aby nie przekroczyć pamięci podczas zmiany objętości danych wejściowych?
Jak pracować z partycjami za pomocą coalesce i repartition?
Jakie obrazy Docker musiałeś zbudować i po co?
Czy istnieją inne mechanizmy zarządzania shuffle oprócz coalesce/repartition?
Jakie parametry Spark JDBC zostały użyte do równoległego odczytu?