Data Engineer
Czym jest dekorator w Pythonie?
Jak nierównomiernie rozłożyć dane tej witryny na trzy shard'y: 50% na pierwszym i po 25% na pozostałych dwóch?
W jakiej sytuacji wyszukiwanie w słowniku może się pogorszyć do najgorszego przypadku?
Jak radzić sobie z niespójnością danych?
Jak monitorowałeś jakość danych?
Z jakimi bazami danych pracowałeś? Jak działa MongoDB i jak się skaluje?
Jak poprawnie otwierać i zamykać pliki w Pythonie za pomocą menedżera kontekstu?
Jeśli harmonogram DAG to @daily, o której godzinie jest on faktycznie uruchamiany?
Jak technicznie zrealizowano równoległe wyładowanie dużej tabeli z PostgreSQL do Spark w przypadku [kontekst]?
Czym różni się list comprehension od zwykłej pętli w Pythonie?
Jak zwykle obsługiwałeś błędy i alerty w pipeline'ach?
Jakie rodzaje JOIN występują w SQL (logiczne) i czym się różnią?
Jak tworzono tabele w klastrze i jak rozwiązano problem, gdy z powodu ZooKeeper brakowało repliki na shardzie?
Z jakich etapów składa się transakcja?
Co robisz w wolnym czasie? Masz jakieś własne projekty?