Как бихте проектирали мащабируемо зареждане на данни от множество REST API: от събиране на данни до S3, с интерфейс за анализатор?
Data Engineer
Какво е процедурният SQL?
Разкажете ни за себе си и опита си в data engineering.
Има 101 обект: 100 нула и 1 едно. След сортиране по резултатите, първо идват 50 нула, след това едно, и още 50 нула. Какви са ROC AUC и формата на ROC кривата?
Какви са недостатъците на индексите освен заетото място?
В градиентния бустинг вече е изградена композиция от N базови алгоритъма. Какво ще бъде целта за новия, N+1-ви алгоритъм?
Защо мързеливите оценки са полезни?
Какво е spill на данни в Spark и как да го избегнете, ако не можете просто да добавите ресурси?
Как бихте се справили с трансформациите на данни с висок товар?
Как се различават режимите на стартиране на Spark: cluster, client и local?
Какви са предимствата и недостатъците на реализирането на API зареждач като персонализиран оператор/hook в Airflow в сравнение с отделна библиотека или контейнерна услуга?
2. Има таблица t, която изброява сумата на транзакциите на клиентите за ден: - Напишете заявка, която за всеки ред показва транзакциите на клиента за текущия и предходния календарен ден Крайната таблица е по-долу:
Какви са мързеливите оценки и как да ги разберем?
Какви типични задачи сте решили в Airflow?
Дата, поръчка номер, сума select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Какви са звездните модели и Data Vault?
Разкажете ли за себе си: къде работихте последно, какво правихте, какво търсите и защо?
Къде се намират Driver и Executors в режим на клъстер и защо се използва в производството?
Къде точно се появява градиентът в алгоритъма за градиентен бустинг, ако базовият алгоритъм е прост дървовиден модел?
От какви компоненти се състои Greenplum и Hadoop HDFS?