Как работи оптимизаторът на заявки в Oracle, на какво обръща внимание и към кой клас принадлежи?
Data Engineer
Какъв е смисълът от разделянето на данните на блокове в HDFS?
Как работехте с Impala?
Какво отличава HDFS от обикновените разпределени файлови системи?
Как работи MapReduce, по-специално етапът Reduce?
Какво е YARN и за какво е нужен?
Как работихте с CI/CD?
Как заредихте данни от S3 в Greenplum?
Какво е shuffle в Spark и защо е важно да го минимизираме?
Как да видите плана за изпълнение на заявка в Oracle? Какво е различното между EXPLAIN PLAN и EXPLAIN ANALYZE?
Разкажете за използването на PL/SQL процедури във вашата работа.
Какво е broadcast join в Spark?
Имали ли сте опит в оптимизацията на Spark задачи? Можете ли да дадете конкретен пример?
Имали ли сте някога нужда да пишете пакети в Oracle?
Работили ли сте с инкрементални и пълни зареждания? Как се справяхте с дублиращите се записи?
Какво е предимството на колонното съхранение пред редовото?
Каква е разликата между RANK и DENSE_RANK?
Как се чете файл от HDFS, например Parquet — цял или на блокове?
Разкажете за партиционирането в Oracle: за какво се използва и какви видове има?
Какво е Hive и как се различава от традиционните релационни бази данни?