Data Engineer
Πώς αξιολογείται η διαμόρφωση για τη μεταφορά ενός terabyte δεδομένων από το PostgreSQL στο ClickHouse;
Ποιες τεχνολογίες χρησιμοποιήσατε για να φορτώσετε δεδομένα σε Parquet και ποια μηχανισμοί χρησιμοποιήθηκαν για την απόκτηση και φόρτωση δεδομένων;
Έχεις δουλέψει με συναρτήσεις παραθύρου; Ποια είδη συναρτήσεων παραθύρου γνωρίζεις;
Αποτελέσματα: | customer_id | gap_days | |-------------|----------| | 1 | 123 | | 2 | 120 | με cte ως( επιλέξτε order_id, customer_id, order_dt, lag(order_dt) πάνω από(κατανομή από customer_id κατά order_dt) ως prev_order_ft, datediff(ημέρα, prev_order_ft, order_dt) ως gap_days από Orders ) επιλέξτε customer_id, max(gap_days) ως gap_days από cte όπου gap_days > 60 group by customer_id
Τι τύπο τυποποίησης χρησιμοποιείται στην Python: στατικό ή δυναμικό;
Έχουμε έναν πίνακα πελατών (id, όνομα, διεύθυνση κ.λπ.), προϊόντων (id, όνομα κ.λπ.), κίνηση προϊόντων (εδώ έχουμε id πελάτη, προϊόν, ημερομηνία, ποσότητα, συνολική), πρέπει να βρούμε ποια προϊόντα πωλήθηκαν στις 1 Ιανουαρίου, μόνο τα μοναδικά, και επίσης να εμφανίσουμε το όνομα του αγοραστή και...
Σε ποια ομάδα και υπό ποια ηγεσία αισθάνεστε πιο άνετα να εργάζεστε;
Έχετε εμπειρία στη βελτιστοποίηση εργασιών Spark; Μπορείτε να δώσετε ένα συγκεκριμένο παράδειγμα;
Ποιος ήταν ο ρόλος σου σε μια ομάδα 4 ατόμων και πώς βλέπεις την καριέρα σου σε 3-4 χρόνια, ποιοι στόχοι θέτεις;
Η αποθήκευση κατασκευάστηκε σύμφωνα με το σχήμα Data Vault — το ανέπτυξες και εσύ, το υποστήριζες; Πρόσθετες χειροκίνητα hubs, links;
Στην οθόνη που εμφανίζεται υπάρχουν δύο δομές δεδομένων· σε ποια από αυτές η αναζήτηση της τιμής 2 θα είναι ταχύτερη και γιατί;
Πώς καταλαβαίνεις την έννοια των κλειδιών στους πίνακες — για ποιο λόγο χρειάζονται;
Πώς φορτώνουμε δεδομένα από το Kafka στο ClickHouse μέσω streaming για αναφορές σε πραγματικό χρόνο;
Μιλήστε για τις βασικές έννοιες του Kafka (ομάδα καταναλωτών, διαμερίσματα, θέματα).
Πώς δημιουργείτε πολλά ίδια tasks παράλληλα στο Airflow (π.χ., να φορτώσετε πολλά ίδια αρχεία);
Ποια μορφή εργασίας σας ταιριάζει: απομακρυσμένη, υβριδική ή γραφείου;
Μπορεί κανείς να δει το σχήμα του πίνακα πριν εκτελέσει το ερώτημα στο Hive;
Πώς βλέπετε την ανάπτυξή σας στη νέα ομάδα και με ποιες εργασίες θα θέλατε να ασχοληθείτε περισσότερο;
Για ποιο λόγο χρησιμοποιούνται οι διακοσμητές στο Apache Airflow;
Αναφορά για την εταιρεία logistics Είστε αναλυτής σε μια εταιρεία logistics που καταγράφει τις επιχειρήσεις σε αποθήκες. Πρέπει να ετοιμάσετε μια αναφορά για την αποδοτικότητα κάθε αποθήκης. Για κάθε αποθήκη, υπολογίστε: • το συνολικό αριθμό επιχειρήσεων (count_operations); • το συνολικό αριθμό προϊόντων που επεξεργάστηκε η αποθήκη (sum_quantity); • τον μέσο χρόνο επεξεργασίας μιας επιχείρησης (avg_processing_time), λαμβάνοντας υπόψη μόνο τις επιχειρήσεις με καθορισμένο χρόνο (όχι NULL), στρογγυλοποιημένο στον πλησιέστερο ακέραιο; • το μέγιστο και ελάχιστο αριθμό προϊόντων που επεξεργάστηκε σε μια επιχείρηση (max_quantity, min_quantity); • τον αριθμό επιχειρήσεων κάθε τύπου («παροχή», «αποστολή», «μετακίνηση») σε ξεχωριστές στήλες: supply_operations, shipment_operations, transfer_operations. Φιλτράρετε τις αποθήκες όπου ο συνολικός αριθμός επιχειρήσεων είναι μεγαλύτερος από 2 και ο μέσος χρόνος επεξεργασίας δεν υπερβαίνει τα 60 λεπτά. Ταξινομήστε το αποτέλεσμα κατά ID αποθήκης σε αύξουσα σειρά. Μορφή εισόδου Πίνακας operations: • operation_id (int) — μοναδικός αναγνωριστικός αριθμός επιχείρησης • warehouse_id (int) — αναγνωριστικός αριθμός αποθήκης • operation_type (text) — τύπος επιχείρησης: «παροχή», «αποστολή», «μετακίνηση»