Data Engineer
Quelle est la différence entre les types de données int et uint dans ClickHouse?
Comment la taille des granulés influence-t-elle la table ClickHouse?
Comment enregistrer un JSON dans un dossier (dans le contexte d'Airflow DAG)
Parlez des concepts de base de Kafka (groupe de consommateurs, partitions, sujets).
[nom] parlez-nous un peu de votre expérience par rapport à nos tâches, que nous avons essayé de décrire dans l'offre d'emploi.
Qu'est-ce que la typage canard (duck typing) ?
Nous allons analyser JSON — qui analysera le JSON ? À ma connaissance, il n'y a pas de fonctions dans ClickHouse.
Qu'est-ce qu'une vue (VIEW) et une vue matérialisée (MATERIALIZED VIEW) dans Oracle ? Comment les données sont-elles mises à jour dans une vue matérialisée ?
Qu'est-ce que LEFT SEMI JOIN et LEFT ANTI JOIN dans Spark SQL, avez-vous déjà dû les utiliser?
Décomposez JSON en la troisième forme normale : comment stockeriez-vous la liste CashBreakdown et comment généreriez-vous des clés de substitution ?
Que souhaitez-vous développer ? Des solutions architecturales spécifiques ?
Qu'est-ce qu'une jointure broadcast dans Spark?
Quelle expression à la place de [...] entraînera automatiquement la création d'un index? Il y a un défilement horizontal du code sur la plateforme mobile create table some_table( col_name [...] ); unique references other_table(col_name) not null serial integer check (col_name > 0)
Parlez-nous de l'utilisation des procédures PL/SQL dans votre travail.
Une séquence spéciale, appelée even_sequence, a été créée pour générer uniquement des nombres pairs. Que doit-on mettre à la place de [...], pour que si aucune valeur n’est spécifiée pour even_column lors de l’insertion, la valeur provienne de even_sequence? create table some_table( even_column [...] ); integer computed as nextval('even_sequence') integer generated always as identity (start with 2 increment by 2) integer default nextval('even_sequence') integer unique default nextval('even_sequence') integer generated by even_sequence’
As-tu déjà dû faire des rapports, des tableaux de bord, des visualisations (BI) ?
Quel est le danger du shuffle dans Spark?
Ont-ils utilisé un seul bucket S3 ou plusieurs ? Selon quel principe ?
Qu'est-ce que la partition de données et comment aide-t-elle à éviter une analyse complète de la table?
Vous avez découvert que dans l'historique du dépôt principal Git, il y a des commits contenant des données confidentielles critiques. Ces données doivent être complètement supprimées de toute l'histoire du dépôt. Évaluez à quel point il serait correct et sûr d'utiliser la stratégie suivante : créer un nouveau commit qui supprime les données confidentielles de la version actuelle des fichiers et le pousser dans main. - Correct, mais pas optimal. Il vaut mieux utiliser git revert pour annuler des commits - Correcte conditionnellement. C'est une solution temporaire jusqu'à ce qu'une méthode plus radicale pour supprimer les données soit trouvée - Incorrecte et non sécurisée. Les données seront supprimées de la version actuelle, mais resteront accessibles dans l'historique du dépôt - Incorrecte. Ce commit peut entraîner de nouveaux conflits lors de la fusion avec d'autres branches - Correct et sécurisé. Cette méthode garantit que les données seront supprimées et ne réapparaîtront plus dans le dépôt