Data Engineer
Czym są dekoratory w Pythonie?
Jakie rodzaje fizycznych JOIN-ów istnieją w Spark?
Z jakimi parametrami silnika Distributed w ClickHouse jesteś zaznajomiony?
Czy znasz ReplicatedQueue? Czy masz doświadczenie w pracy z nią?
Jak uniemożliwić, aby nieprawidłowe dane załadowane do witryny lub tabeli pośredniej trafiły do wyższych pipeline'ów?
Ile łącznie pracowałeś z Spark i jak głęboko się w niego zaangażowałeś?
Czym są operacje leniwe w Spark i do czego służą?
Co się dzieje w PostgreSQL po wykonaniu zapytania SELECT * FROM [tabela]?
Czy można stworzyć i zastosować dekorator bez składni @?
Jak pracować z partycjami za pomocą coalesce i repartition?
Jak ustalili, że wpis już istnieje i nie trzeba go ponownie zapisywać?
NULL plus 5 — ile to będzie?
Czy można odczytywać dane równolegle z jednego pliku Parquet w Spark, czy tylko jednym rdzeniem w jednym zadaniu?
Z jakimi formatami plików pracowałeś?
Opowiedz o sobie: doświadczenia, zadania, funkcje lub osiągnięcia, z których jesteś dumny.
Czy masz doświadczenie z FastAPI?
Czy przeprowadzałeś kontrole statystyczne?
Czym jest dekorator w Pythonie?
Jak nierównomiernie rozłożyć dane tej witryny na trzy shard'y: 50% na pierwszym i po 25% na pozostałych dwóch?
W jakiej sytuacji wyszukiwanie w słowniku może się pogorszyć do najgorszego przypadku?