Data Engineer
Opowiedz ogólnie, jak zbudowana jest architektura Spark: jakie komponenty istnieją i jak one współdziałają podczas wykonywania zapytania SQL.
Czy pracowałeś z FTP w celu uzyskania plików lub danych przez portal?
## zadanie dotyczące dominaty # Jest lista liczb. Napisz funkcję, która znajdzie dominatę tej listy. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Dlaczego zdecydowałeś się wyodrębnić ranking do osobnego CTE? Dlaczego nie można było go użyć od razu w pierwszym CTE?
Czym jest partycjonowanie? Czym jest sharding? Czym jest replikacja?
Czy pracowałeś z witrynami danych (warstwa DWH)?
Dlaczego rozważasz oferty pracy w tej chwili?
Jaka jest różnica między wirtualizacją a konteneryzacją (Docker)?
Czy pracowałeś z parametrami i hintami określającymi użycie Broadcast Join?
Jak są orkiestrowane wdrożenia w DBT? Używasz Airflow?
Jaką operację wykonała komenda? - Wykonała git revert na commit z config.yaml - Wykonała git filter-branch --index-filter "git rm --cached config.yaml" -- --all - Wykonała git rebase -i usuwając commity zawierające zmiany w pliku - Wykonała git commit --amend i git push --force - Użyła git cherry-pick do utworzenia nowej gałęzi bez config.yaml
Jak zapewnić globalną unikalność klucza głównego w PostgreSQL podczas sharding?
Jak uniemożliwić, aby nieprawidłowe dane załadowane do witryny lub tabeli pośredniej trafiły do wyższych pipeline'ów?
W jakich przypadkach używać indeksów B-drzew i hash w PostgreSQL?
Jak działa Hash Join?
Jakie są cechy i różnice między Set a List w Pythonie? Oprócz wydajności, jakie inne cechy mają?
Jak wykryć odchylenie danych (data skew) w Spark?
Opowiedz o kilku swoich najważniejszych zadaniach związanych z jakością danych.
Co się działo, gdy uruchamiano ograniczenie jakości danych: alert, awaria, ponowne uruchomienie?
Czym jest indeks? Czym różni się indeks klastrowany od nieklastrowanego?