Data Engineer
Potrzebujesz szybko przywrócić kilka plików do wersji z ostatniego commita, nie naruszając innych zmian. Jak postępować? git reset --hard HEAD Usuń i utwórz pliki ręcznie git fetch i git merge git revert HEAD git checkout HEAD^ <plik1> <plik2>
Czy musiałeś pracować z Oracle Data Integrator (ODI)?
Jakie zadanie w Pythonie rozwiązałeś ostatnio w produkcji?
Jakie inne formaty plików, oprócz Parquet, dobrze współpracują z Hadoop i Hive?
Czym jest zmienna var, jakiego jest typu?
Czy używałeś Bridge i tabel PIT w Data Vault? Podaj przykład i wyjaśnij ich cel.
Duże przechowywanie było — jak trudne było utrzymanie go ręcznie w objętościach i obiektach?
Czym jest widok materializowany i czym różni się od zwykłego widoku?
Opowiedz o swoim doświadczeniu z Airflow (orkiestratorem). Z czego korzystałeś?
Czy pracowałeś z tokenami JWT? Z jakich bloków się składają?
Co należy zrobić, jeśli chcesz zmienić gałąź, na którą wskazuje podmoduł? - Podmoduły nie obsługują zmiany gałęzi - Usunąć podmoduł i dodać go ponownie z żądaną gałęzią - Zmienić gałąź w podmodule i wykonać commit w głównym repozytorium - Wykonać git checkout na żądanej gałęzi w podmodule i zatwierdzić zmiany w głównym repozytorium - Wykonać git submodule update --branch, wskazując nową gałąź
Dlaczego oddziela się widoki (VIEW) i tabele? Do czego służą widoki?
Czy ładowałeś dane z Spark do S3 w formacie Parquet, a następnie z Parquet do Greenplum — jak wygląda proces ładowania?
Opowiedz o partycjonowaniu. Jakie ciekawe operacje musiałeś wykonać?
Jak zwykle podchodzisz do budowy procesów ETL i ELT? W czym różnią się te procesy?
Od czego zacząłbyś realizację projektu?
Czy byłeś za nich jedynym odpowiedzialnym — wszystko robiłeś sam?
-- Dana tabela numbers z jedną kolumną num (liczby całkowite, mogą się powtarzać). -- Napisz zapytanie SQL, które podzieli liczby na dwie kolumny: -- even – liczby parzyste (posortowane rosnąco) -- odd – liczby nieparzyste (posortowane rosnąco) -- Liczby powinny być ułożone wiersz po wierszu: w pierwszym wierszu – pierwsza liczba parzysta i pierwsza nieparzysta, -- w drugim wierszu – druga liczba parzysta i druga nieparzysta itd. -- Jeśli w jednej grupie jest więcej liczb niż w drugiej, brakujące miejsca powinny być NULL. -- tabela źródłowa -- num -- --------- -- [phone] -- wynik zapytania -- even | odd -- -----|----- -- 2 | 1 -- 4 | 3 -- 6 | 5 -- 8 | 7 -- 10 | 9 -- NULL | 11 -- NULL | 11
Jakie magiczne metody Pythona należy uwzględnić?
Jak Twoje doświadczenie odpowiada obowiązkom na stanowisku: wsparcie i analiza procesów ładowania, monitorowanie i wykrywanie anomalii, testowanie i wdrażanie poprawek w produkcji, wsparcie drugiej linii, sprawdzanie dokumentacji technicznej?