Data Engineer
Où peut-on voir les journaux des tâches dans Airflow?
CREATE TABLE orders ( driver_id varchar, city varchar, order_id varchar ); -- Obtenir les 10 meilleurs conducteurs par nombre de commandes dans chaque ville
On donne deux tables t1 et t2. La tâche consiste à énumérer tous les types de joins que vous connaissez et le résultat de la requête select * from t1 <join> t2 on t1.t = t2.t pour chacun d'eux. |t1.t| ------ 1 2 4 null ------ |t2.t| ------ 1 3 null null
Où la compression des données fonctionne-t-elle mieux : dans le stockage en colonnes ou en lignes, et pourquoi?
SELECT * FROM table1 AS t1 LEFT JOIN table2 AS t2 ON t1.date_start > t2.date_start
SÉLECTIONNEZ * DE table1 AS t1 JOINTURE GAUCHE table2 AS t2 ON t1.date_start > t2.date_start d = { True: 42, 1: 2, 1.0: 100500 } print(d)
Qu'est-ce que les index dans les bases de données, à quoi servent-ils et quelle est leur structure interne?
Quelle est la différence entre une boucle sur une chaîne de caractères et une boucle sur un tuple en Python ? Quels types sont fondamentaux et comment cela influence-t-il la performance ?
Analyse de la fréquentation des clubs de fitness Vous travaillez en tant qu’analyste dans une chaîne de clubs de fitness. Vous disposez d’informations sur les visites des utilisateurs et les abonnements qu’ils achètent. Il est nécessaire d’analyser l’efficacité de l’utilisation des abonnements. Calculez pour chaque type d’abonnement : • le nombre total d’utilisateurs ayant utilisé ce type d’abonnement. Ne considérez que les user_id uniques; • le nombre total de visites pour cet abonnement. Considérez toutes les visites des utilisateurs avec cet abonnement; • la part des utilisateurs de cet abonnement en pourcentage du nombre total d’utilisateurs (arrondi à un chiffre après la virgule). Pour calculer la part, utilisez le rapport entre le nombre d’utilisateurs avec cet abonnement et le nombre total d’utilisateurs uniques. Chaque utilisateur ne peut avoir qu’un seul abonnement. Triez le résultat par type d’abonnement par ordre alphabétique. Format d’entrée Table memberships : • membership_id (int) — identifiant unique de l’abonnement • user_id (int) — identifiant unique de l’utilisateur • membership_type (text) — type d’abonnement Table visits : • visit_id (int) — identifiant unique de la visite • user_id (int) — identifiant de l’utilisateur • visit_date (timestamp) — date et heure de la visite Les données ne contiennent pas de valeurs manquantes ou incorrectes. Format de sortie La requête doit retourner une table avec les champs dans cet ordre : • membership_type (text) — type d’abonnement • users_count (int) — nombre d’utilisateurs uniques avec ce type d’abonnement • total_visits (int) — nombre total de visites des utilisateurs avec cet abonnement • user_share (numeric) — part des utilisateurs en pourcentage avec cet abonnement par rapport au total (arrondi à 1 décimale) Le résultat est trié par type d’abonnement par ordre alphabétique.
Threading, multiprocessing, asyncio : quelle est la différence et quand est-il préférable d'utiliser quoi ?
Parlez-nous de votre expérience avec Greenplum, DBT et Data Vault. Pourquoi êtes-vous passé du modèle en étoile au Data Vault?
Comment aborder la situation lorsque le business demande un rapport avec une visualisation des données sur une nouvelle promotion?
Dis-moi ce que tu sais sur le stockage des données en colonnes et en lignes. Quand et lequel faut-il choisir et pourquoi?
Parle-moi de ton expérience professionnelle : tâches, pile technologique
Quelle est la différence entre RANK() et DENSE_RANK() ?
Où apparaît le parallélisme dans Airflow?
Pourquoi Pandas est-il meilleur que les listes et dictionnaires ordinaires en Python?
Comment Pandas gère-t-il les données manquantes?
Comment avez-vous travaillé avec Impala?
Quelle mémoire supplémentaire une solution avec dictionnaire nécessite-t-elle, sans compter les données retournées?