Comment fonctionne l'optimiseur de requêtes dans Oracle, que regarde-t-il et à quelle classe appartient-il?
Data Engineer
Quel est le but de diviser les données en blocs dans HDFS?
Comment avez-vous travaillé avec Impala?
Quelle est la différence entre HDFS et les systèmes de fichiers distribués classiques?
Comment fonctionne MapReduce, en particulier l'étape Reduce?
Qu'est-ce que YARN et à quoi sert-il?
Comment avez-vous travaillé avec CI/CD?
Comment avez-vous chargé les données de S3 dans Greenplum?
Qu'est-ce que shuffle dans Spark et pourquoi est-il important de le minimiser?
Comment voir le plan d'exécution d'une requête dans Oracle ? En quoi EXPLAIN PLAN diffère-t-il de EXPLAIN ANALYZE ?
Parlez-nous de l'utilisation des procédures PL/SQL dans votre travail.
Qu'est-ce qu'une jointure broadcast dans Spark?
Avez-vous déjà dû écrire des packages dans Oracle?
Avez-vous de l'expérience dans l'optimisation des tâches Spark ? Pouvez-vous donner un exemple concret ?
Avez-vous travaillé avec des chargements incrémentiels et complets ? Comment avez-vous géré les doublons ?
Comment un fichier HDFS, par exemple Parquet, est-il lu — en entier ou en blocs?
Quelle est la différence entre RANK et DENSE_RANK?
Quel est l'avantage du stockage en colonne par rapport au stockage en ligne?
Comment fonctionne la partition dans Hive et comment est-elle représentée physiquement dans le système de fichiers?
Pouvez-vous expliquer le partitionnement dans Oracle : à quoi cela sert-il et quels sont les types ?