Data Engineer
Ποια εργαλεία ανίχνευσης χρησιμοποιήθηκαν; Στο Spring Boot 2 και Spring Boot 3;
Χρησιμοποιήθηκε η μέθοδος σύγκρισης hashes εγγραφών για τον υπολογισμό της διαφοράς μεταξύ πηγής και πίνακα προορισμού;
Περιγράψτε τη διαδικασία αρχειοθέτησης δεδομένων από Oracle σε Parquet (HDFS) κατά τμήματα και το αντίστροφο pipeline ανάκτησης δεδομένων. Πώς λύνετε το πρόβλημα της επανααρχειοθέτησης των αποκατεστημένων δεδομένων;
Πώς οργανώνετε συνήθως τη δουλειά σας πάνω σε εργασίες και πώς παρακολουθείτε την πρόοδο;
Γιατί αποφασίσατε να βγάλετε την κατάταξη σε ένα ξεχωριστό CTE; Γιατί δεν μπορούσε να χρησιμοποιηθεί άμεσα στο πρώτο CTE;
LeetCode #? — Στο PostgreSQL υπάρχει ένας πίνακας [πίνακας] με μία μόνο στήλη id και τιμές 1, 1, 2. Γράψτε ένα ερώτημα DELETE που θα διαγράψει φυσικά ένα διπλότυπο.
Με ποια παραμέτρους του κινητήρα Distributed στο ClickHouse είστε εξοικειωμένοι;
Έχετε εμπειρία στη ρύθμιση pipelines σε CI/CD, για παράδειγμα, GitLab;
Ποια είναι η διαφορά μεταξύ WHERE και HAVING σε SQL;
Τι συνέβη και πώς να επαναφέρετε την εργασία;
Με το streaming, λειτουργούσε το Iceberg, άκουσες; Είναι μια αποθήκη αρχείων σκουπίδια.
Ποια μορφή εργασίας προτιμάτε: γραφείο, υβριδικό ή απομακρυσμένο; Έχουμε δύο γραφεία, στη Kutuzovsky και στη Tula.
Ποια είναι η διαφορά μεταξύ Greenplum και PostgreSQL;
Πείτε μας περισσότερα για την ανισορροπία δεδομένων μεταξύ των shards: πώς προσδιορίστηκε και πώς χρησιμοποιήθηκε η αντίστοιχη λειτουργία/μηχανισμός;
Πες μου για την κατανόησή σου για την ποιότητα των δεδομένων — έχεις εμπειρία σε αυτόν τον τομέα;
Τι θα συμβεί όταν εφαρμόζετε `s ** 2` στη λίστα `s = [1, 2, 3]`;
Τύποι JOIN και οι διαφορές τους
Σε ποια σειρά πραγματοποιούνται οι βασικές λειτουργίες στη SQL: SELECT, FROM κ.λπ.;
Πόσα ήταν συνολικά τα downloads — εργασίες υψηλού επιπέδου, νήματα;
Πώς φορτώθηκαν τα δεδομένα από τον εξωτερικό πίνακα στους τελικούς πίνακες;