Jak działa optymalizator zapytań w Oracle, na co zwraca uwagę i do jakiej klasy należy?
Data Engineer
Jaki jest cel dzielenia danych na bloki w HDFS?
Jak pracowali z Impala?
Czym HDFS różni się od zwykłych rozproszonych systemów plików?
Jak działa MapReduce, w szczególności faza Reduce?
Czym jest YARN i do czego służy?
Jak pracowali z CI/CD?
Jak załadowałeś dane z S3 do Greenplum?
Czym jest shuffle w Spark i dlaczego ważne jest jego minimalizowanie?
Jak obejrzeć plan wykonania zapytania w Oracle? Czym różni się EXPLAIN PLAN od EXPLAIN ANALYZE?
Opowiedz o wykorzystaniu procedur PL/SQL w swojej pracy.
Czym jest broadcast join w Spark?
Czy masz doświadczenie w optymalizacji zadań Spark? Możesz podać konkretny przykład?
Czy musiałeś kiedyś pisać pakiety w Oracle?
Czy pracowałeś z ładowaniami przyrostowymi i pełnymi? Jak radziłeś sobie z duplikatami?
Jaka jest zaleta przechowywania kolumnowego w porównaniu do przechowywania wierszowego?
Jak odczytywany jest plik z HDFS, na przykład Parquet — w całości czy po blokach?
Czym różni się RANK od DENSE_RANK?
Czym jest Hive i czym różni się od tradycyjnych relacyjnych baz danych?
Opowiedz o partycjonowaniu w Oracle: do czego służy i jakie są jego rodzaje?