Data Engineer
Πώς σχεδίαζες το σχήμα της βάσης δεδομένων; το έκανες χειροκίνητα στη βάση, ή αποθήκευες τα scripts κάπου, ή χρησιμοποιούσες το Liquibase; ποια ήταν η διαδικασία;
Ποιες φυσικές στρατηγικές εκτέλεσης join γνωρίζετε;
Ποιο φυσικό μηχανισμό JOIN θα χρησιμοποιηθεί κατά την ένωση του πίνακα συναλλαγών με τον πίνακα ημερολογίου με την προϋπόθεση ανισότητας (ημερομηνία <= ημερομηνία);
Πώς λειτουργεί η Nested Loop Join και ποια είναι η αλγοριθμική της πολυπλοκότητα; Ποια είναι η πολυπλοκότητα και των τριών αλγορίθμων;
Τι έχεις γράψει σε Python εκτός από το Airflow DAG;
Υπάρχει μια έννοια που ονομάζεται επίπεδα απομόνωσης συναλλαγών. Τι γνωρίζετε γι' αυτό;
Ποια είναι η διαφορά μεταξύ repartition και coalesce στο Spark;
Τι θα επιστρέψει η συνάρτηση find_mode για τη λίστα [1, 2, 3, 3, 4, 5]; Εξήγη βήμα προς βήμα.
Έχετε γράψει μονάδες δοκιμών; Έχετε αυτήν την εμπειρία;
Έχουμε ένα ORDER BY κατά τον αριθμό παραγγελιών, και υπάρχουν δύο παραγγελίες με 5, άλλες δύο με 3. Πώς θα συμπεριφερθούν τα RANK() και DENSE_RANK();
Έχετε εμπειρία στη συγγραφή τεκμηρίωσης;
Υπάρχουν λειτουργίες και δυνατότητες στο Greenplum που δεν υπάρχουν σε κανονικό MySQL και άλλες διαλέκτους;
Ποια είναι η εμπειρία και η κατανόησή σου στην κατασκευή pipelines για τον υπολογισμό βιτρινών (επεξεργασία δεδομένων);
Δώστε ένα παράδειγμα όταν καταφέρατε να βελτιώσετε τις διαδικασίες ή τα εργαλεία για την ομάδα.
Δημιουργείτε έναν πίνακα audit_logs όπου πρέπει να αποθηκεύσετε την ημερομηνία και την ακριβή ώρα με ζώνη ώρας. Ποιος τύπος δεδομένων είναι ο πιο κατάλληλος; ώρα με ζώνη ώρας διάστημα χρονοστίγμα με ζώνη ώρας ημερομηνία χρονοστίγμα χωρίς ζώνη ώρας
Πείτε μας για τις βέλτιστες πρακτικές χρήσης ευρετηρίων - πότε και πόσο συχνά πρέπει να τα χρησιμοποιείτε.
Πες μου για το επίπεδο Python σου: τι χρησιμοποίησες, πόσο βαθιά γνωρίζεις τον αντικειμενοστραφή προγραμματισμό
Πώς να μειώσετε την κατανάλωση μνήμης του DataFrame στο Pandas;
ΔΗΜΙΟΥΡΓΗΣΤΕ ΠΙΝΑΚΑ raw.local_transactions ΣΤΟ CLUSTER cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) ΜΗΧΑΝΗ = ReplicatedMergeTree() ΔΙΑΜΕΡΙΣΜΑΤΙΣΜΟΣ ΜΕ βάση το amount ΤΑΞΙΝΟΜΗΣΤΕ ΜΕ (transaction_id); ΔΗΜΙΟΥΡΓΗΣΤΕ ΠΙΝΑΚΑ raw.transactions ΣΤΟ CLUSTER cluster_4x2 ( transaction_id String, user_id String, amount Float64, created_at DateTime ) ΜΗΧΑΝΗ = Distributed('cluster_4x2', 'raw', 'local_transactions', cityHash64(user_id));
Πώς μπορεί να διαχειριστεί κανείς το shuffle στο Spark (κατανομή, broadcast join κ.λπ.)?