Quels outils ont-ils utilisés lors du développement?
System Analyst
Avez-vous utilisé Kafka/RabbitMQ pour le traitement de flux de données dans le projet ? Que faisiez-vous exactement ?
Dans le CV, Kafka était mentionné — qu'est-ce que c'est, l'ont-ils utilisé?
Quelles vérifications de base de la qualité des données étaient généralement configurées?
-- 1. Lister les clients sans commandes au cours du dernier mois. -- Structure : -- customers (customer_id, name, registration_date) -- orders (order_id, customer_id, order_date, amount) SELECT DISTINCT c.customer_id, c.name FROM customers c LEFT JOIN orders o ON c.customer_id = o.customer_id and o.order_date >= DATE_TRUNC('month', CURRENT_DATE) - INTERVAL '1 month') WHERE o.amount IS NULL -- 2. Calculer la part de chaque sous-catégorie dans le chiffre d'affaires total de la catégorie -- sales (product_id, category, subcategory, revenue, sale_date) -- Résultat attendu : category | subcategory | share_of_category
Parlez-moi du projet chez [organisation] concernant le développement de DWH et l'analyse en quasi temps réel des objets de construction : quels étaient les objectifs, comment ont-ils été résolus, quelles ont été les réalisations ?
Parlez de votre expérience — quels projets avez-vous réalisés (consulting, [organisation], Econsoft, Beeline)?
-- 1. Lister les clients sans commandes au cours du dernier mois. -- Structure : -- customers (customer_id, name, registration_date) -- orders (order_id, customer_id, order_date, amount) SELECT DISTINCT c.customer_id, c.name FROM customers c LEFT JOIN orders o ON c.customer_id = o.customer_id and o.order_date >= DATE_TRUNC('month', CURRENT_DATE) - INTERVAL '1 month' WHERE o.amount IS NULL -- 2. Calculer la part de chaque sous-catégorie dans le chiffre d'affaires total de la catégorie -- sales (product_id, category, subcategory, revenue, sale_date) -- Résultat attendu : category | subcategory | share_of_category
Parlez-moi de la configuration CI/CD et de la conteneurisation dans Docker sur le projet — qu'avez-vous fait exactement?
La charge de données elle-même a-t-elle été écrite directement en Python?
Pouvez-vous expliquer quelles approches de conception d'architecture de stockage de données avez-vous utilisées ? Au moins théoriquement.
Avez-vous de l'expérience en optimisation dans ClickHouse (y compris le chargement de données) ?
Dans l'équipe, il y avait deux ingénieurs en données qui s'occupaient de la mise en œuvre, et vous étiez responsable de l'architecture et des exigences, n'est-ce pas?
Dans quelle mesure connaissez-vous Data Vault, ses types d'objets (Hub, Link, Satellite) et l'approche de conception?
Avez-vous travaillé sur la qualité des données ? Avez-vous utilisé un système de vérification ?
Quel rôle avez-vous joué dans tous ces projets : en tant que développeur ou en tant qu'analyste définissant les exigences pour les développeurs?