Data Engineer
Έχετε εργαστεί με feature store;
Έχετε εμπειρία στη ρύθμιση pipelines σε CI/CD, για παράδειγμα, GitLab;
Ποια είναι η διαφορά μεταξύ WHERE και HAVING σε SQL;
Πώς θα περιέγραφες στον κώδικα έναν έλεγχο ότι μια τιμή διαφέρει σημαντικά από μια κανονική (αναμενόμενη) κατανομή;
Τι συνέβη και πώς να επαναφέρετε την εργασία;
Με το streaming, λειτουργούσε το Iceberg, άκουσες; Είναι μια αποθήκη αρχείων σκουπίδια.
Ποια μορφή εργασίας προτιμάτε: γραφείο, υβριδικό ή απομακρυσμένο; Έχουμε δύο γραφεία, στη Kutuzovsky και στη Tula.
Ποια είναι η διαφορά μεταξύ Greenplum και PostgreSQL;
Τι είναι το CROSS JOIN και ποιο είναι το αποτέλεσμα της εφαρμογής του;
Πώς διορθώσατε την προκατάληψη των δεδομένων ανά client_id όταν ένας πελάτης ήταν σημαντικά μεγαλύτερος από τους άλλους; Ποιες είναι οι επιλογές;
Τι σε ελκύει στον τομέα του travel; Ίσως σου αρέσει να ταξιδεύεις ο ίδιος, ή το travel-tech σε έχει ενδιαφέρει με κάποιο τρόπο;
Σε ποια σειρά πραγματοποιούνται οι βασικές λειτουργίες στη SQL: SELECT, FROM κ.λπ.;
Πώς μεταφέρουμε δεδομένα μεταξύ εργασιών στο Airflow;
Πώς φορτώθηκαν τα δεδομένα από τον εξωτερικό πίνακα στους τελικούς πίνακες;
Τι είναι το trigger για τη δημιουργία μιας νέας εργασίας στο Spark και πώς διαιρείται η εργασία σε Stages και Tasks;
Πες μας λίγα πράγματα για τον εαυτό σου: με τι ασχολήθηκες, ποια τεχνολογία χρησιμοποίησες και τι είδους έργο ήταν;
Τι είναι βιτρίνα δεδομένων;
Έχετε ερωτήσεις σχετικά με την ομάδα και τον ρόλο;
Σε ποιες τεχνολογίες βασίζεται το lakehouse σας και ποια προβλήματα προκύπτουν κατά την εργασία με το Apache Iceberg;
Παρακαλώ πες μου για την εμπειρία σου τον τελευταίο χρόνο: ποια ομάδα, ποιες εργασίες, ποιος ρόλος και ποια ήταν η πιο ενδιαφέρουσα εργασία.