Τι είναι το LEFT SEMI JOIN και το LEFT ANTI JOIN στο Spark SQL, το έχετε χρησιμοποιήσει ποτέ;
Data Engineer
Τι είναι ο διαχωρισμός; Τι είναι το sharding; Τι είναι η αναπαραγωγή;
Τι είναι το trigger για τη δημιουργία μιας νέας εργασίας στο Spark και πώς διαιρείται η εργασία σε Stages και Tasks;
Αν θέσουμε μια συνθήκη φιλτραρίσματος με βάση την ημερομηνία συναλλαγής στο WHERE (μετά το LEFT JOIN), θα περιορίσει αυτό το αποτέλεσμα στον πρώτο πίνακα (πελάτες);
Για τι ευθύνεται η Ομάδα Γραμμών στη δομή του αρχείου Parquet;
-- t1 -- num --------- -- 1 -- 2 2 null null 4 -- t2 -- num --------- -- [τηλέφωνο] null null 5 ΕΠΙΛΕΞΤΕ a.num ΩΣ a_num, b.num ΩΣ b_num ΑΠΟ t1 a ΑΡΙΣΤΕΡΗ JOIN t2 b ON a.num = b.num;
SELECT client_id, ФИО, SUM(suma) AS total_amount FROM clients JOIN transactions ON clients.client_id = transactions.client_id WHERE дата = '2025-05-01' GROUP BY client_id, ФИО;
Τι θα επιστρέψει η συνάρτηση find_mode για τη λίστα [1, 2, 3, 3, 4, 5]; Εξήγη βήμα προς βήμα.
Ποια είναι η διαφορά μεταξύ διαμέρισης και sharding;
Ποια είναι η διαφορά μεταξύ της μορφής αποθήκευσης Parquet και CSV;
## ερώτηση για τη μόδα # Υπάρχει μια λίστα αριθμών. Γράψτε μια συνάρτηση που βρίσκει τη μόδα αυτής της λίστας. # find_mode([1, 2, 3, 3, 4, 5]) #> 3
Πες μου πού εργάστηκες ως συστημικός αναλυτής και ποιες εργασίες εκτέλεσες;
Ποιες μέθοδοι (τύποι) αποθήκευσης ιστορικού δεδομένων γνωρίζετε; Πώς συσσωρεύεται η ιστορία στους πίνακες;
Ποιοι τύποι φυσικών JOIN υπάρχουν στο Spark;
Πώς να εμφανίσετε το τελευταίο πλήρες όνομα κάθε πελάτη, εάν γνωρίζετε μόνο την ημερομηνία έναρξης (ημερομηνία λήξης δεν είναι γνωστή);
Ελέγχους ποιότητας δεδομένων τους κάνατε εσείς ή οι απαιτήσεις προέρχονταν από την επιχείρηση/πελάτες;
Ποιο φυσικό μηχανισμό JOIN θα χρησιμοποιηθεί κατά την ένωση του πίνακα συναλλαγών με τον πίνακα ημερολογίου με την προϋπόθεση ανισότητας (ημερομηνία <= ημερομηνία);
Τι σημαίνει το UNBOUNDED PRECEDING στα όρια της παραθύρου λειτουργίας;
Ποια μορφή εργασίας προτιμάτε: γραφείο, υβριδικό ή απομακρυσμένο; Έχουμε δύο γραφεία, στη Kutuzovsky και στη Tula.
Έχετε δουλέψει ποτέ με τον βελτιστοποιητή AQE (Προσαρμοστική Εκτέλεση Ερωτήσεων) στο Spark; Ξέρετε πώς λειτουργεί;