Comment concevriez-vous un chargement de données évolutif à partir de plusieurs API REST : de l'acquisition des données à S3, avec une interface pour un analyste?
Data Engineer
Qu'est-ce que le SQL procédural?
Parlez-nous de vous et de votre expérience en ingénierie des données.
Il y a 101 objets : 100 zéros et 1 un. Après tri par score, 50 zéros viennent en premier, puis un, puis encore 50 zéros. Quelle est la ROC AUC et la forme de la courbe ROC?
Quels sont les inconvénients des index en dehors de l'espace qu'ils occupent?
Dans le boosting par gradient, une composition de N algorithmes de base a déjà été construite. Quel sera l'objectif pour le nouvel algorithme, N+1-ième?
Pourquoi les évaluations paresseuses sont-elles utiles?
Qu'est-ce que le data spill dans Spark et comment l'éviter si l'ajout de ressources n'est pas simple ?
Comment géreriez-vous les transformations de données à haute charge?
Comment diffèrent les modes de lancement de Spark : cluster, client et local ?
Quels sont les avantages et inconvénients de mettre en œuvre un chargeur API en tant qu'opérateur/hook personnalisé d'Airflow par rapport à une bibliothèque ou un service de conteneurs séparé?
2. Il y a une table t, qui liste la somme des transactions des clients par jour: - Écrivez une requête qui pour chaque ligne montre les transactions du client pour le jour calendaire actuel et le précédent La table finale est ci-dessous:
Qu'est-ce que l'évaluation paresseuse et comment la comprendre?
Quelles tâches typiques avez-vous résolues dans Airflow?
date, numéro de commande, montant select date, sum(amount) as sum_amount from t group by date having sum(amount) > 1000000 order by sum_amount desc limit 3
Qu'est-ce que les modèles en étoile et Data Vault?
Parlez-nous de vous : où avez-vous travaillé récemment, que faisiez-vous, ce que vous recherchez et pourquoi ?
Où se trouvent le Driver et les Executors en mode cluster et pourquoi est-il utilisé en production ?
Où exactement se produit le gradient dans l'algorithme de boosting par gradient si l'algorithme de base est un arbre de décision simple?
De quels composants se compose Greenplum et Hadoop HDFS ?