Data Engineer
Ποια εντολή από τον ριζικό φάκελο του έργου πρέπει να χρησιμοποιηθεί για να ενημερώσετε το υπο-μονάδα docs/ στην τελευταία έκδοση από το αποθετήριο και να προετοιμάσετε αυτή την αλλαγή για το commit; git fetch docs/ && git merge docs/FETCH_HEAD git pull --recurse-submodules git submodule update --remote docs/ cd docs/ && git pull && cd .. && git commit -am "Ενημέρωση" git submodule update --init docs/
Έχετε εμπειρία στη συγγραφή τεκμηρίωσης;
Ποια είναι η εμπειρία και η κατανόησή σου στην κατασκευή pipelines για τον υπολογισμό βιτρινών (επεξεργασία δεδομένων);
Αν θέσουμε μια συνθήκη φιλτραρίσματος με βάση την ημερομηνία συναλλαγής στο WHERE (μετά το LEFT JOIN), θα περιορίσει αυτό το αποτέλεσμα στον πρώτο πίνακα (πελάτες);
Έχετε εμπειρία στη ρύθμιση pipelines σε CI/CD, για παράδειγμα, GitLab;
Με το streaming, λειτουργούσε το Iceberg, άκουσες; Είναι μια αποθήκη αρχείων σκουπίδια.
Πώς να μειώσετε την κατανάλωση μνήμης του DataFrame στο Pandas;
Πώς λειτουργεί το Hash Join;
Πώς μπορεί να διαχειριστεί κανείς το shuffle στο Spark (κατανομή, broadcast join κ.λπ.)?
Ποια εργαλεία ανίχνευσης χρησιμοποιήθηκαν; Στο Spring Boot 2 και Spring Boot 3;
Είσαι εξοικειωμένος με τους OLAP κύβους; Όταν εργαζόμαστε με πολυδιάστατα δεδομένα, παρόμοια με έναν πίνακα Pivot στο Excel, αλλά για πιο γρήγορη αλληλεπίδραση με μεγάλα όγκο δεδομένων.
Έχετε εργαστεί με αυξήσεις και πλήρεις φορτώσεις; Πώς αντιμετωπίσατε τα διπλότυπα;
Πώς προτείνει το Git Flow να διαμορφωθεί μια νέα έκδοση της εφαρμογής; - Δημιουργώντας ένα νέο issue-branch - Δημιουργώντας ένα hotfix-branch από το master - Δημιουργώντας ένα ξεχωριστό release-branch από το develop - Κάνοντας άμεμο commit στο branch master - Συγχωνεύοντας απευθείας το branch master με το develop
Έχετε εμπειρία με το Table Engine Join στο ClickHouse;
Πώς καθορίζει το Spark ότι ένας πίνακας είναι αρκετά 'μικρός' για broadcast join (ανώτατο όριο);
Ποια είναι η διαφορά μεταξύ εικονικοποίησης και κοντεϊνεροποίησης (Docker);
Έχουμε ένα ORDER BY κατά τον αριθμό παραγγελιών, και υπάρχουν δύο παραγγελίες με 5, άλλες δύο με 3. Πώς θα συμπεριφερθούν τα RANK() και DENSE_RANK();
Πώς διακρίνεις τους τεχνικούς και επιχειρηματικούς ελέγχους δεδομένων, και ποιος πρέπει να θέτει τις απαιτήσεις γι' αυτούς;
Ποιοι ήταν οι καταναλωτές δεδομένων και πώς χτίζονταν οι βιτρίνες;
Ποια είναι η διαφορά μεταξύ WHERE και HAVING σε SQL;