Πόσο καλά γνωρίζετε το Linux/Docker;
Data Engineer
Τι είναι το shuffle στο Spark και γιατί είναι απαραίτητο;
Πώς μπορεί να διαχειριστεί κανείς το shuffle στο Spark (κατανομή, broadcast join κ.λπ.)?
Τι προσφέρει η μορφή Iceberg σε σύγκριση με το συνηθισμένο Parquet;
Γνωρίζετε τις κοινές εκφράσεις πίνακα (CTE); Δώστε ένα παράδειγμα χρήσης.
Πώς βρίσκω μια υποακολουθία σε μια συγκεκριμένη στήλη αρχείου καταγραφής στο Linux (π.χ., την ημερομηνία στην τρίτη στήλη);
Τι είναι η στατιστική στο πλαίσιο των συστημάτων διαχείρισης βάσεων δεδομένων και της βελτιστοποίησης ερωτημάτων;
[όνομα] μίλησε για την εμπειρία του με διάφορα συστήματα διαχείρισης βάσεων δεδομένων, πόσο βαθιά χρειάστηκε να εμβαθύνει στη βελτιστοποίηση και τις εσωτερικές λεπτομέρειες.
Λεπτομερώς περιγράψτε τον αλγόριθμο καταγραφής του αυξήματος από την πηγή ώστε να μην χάνεται τίποτα κατά την αλλαγή της συχνότητας φόρτωσης.
Πώς οργανώνεται η ανάγνωση ενός ίδιου μηνύματος από το Kafka από πολλούς διαφορετικούς καταναλωτές (fan-out);
Πώς να λύσετε το πρόβλημα όταν η διαδικασία ανάγνωσης μπορεί να δει μια ενδιάμεση (μη συνεπή) κατάσταση του πίνακα κατά τη διάρκεια ενός πολύσταδιού ETL (delete+insert) στο Iceberg;
Τι είναι ένα "νεκρό ζεύγος" (dead tuple);
Πώς συγκρίνουμε τον αρχικό ("ζωντανό") και τον τελικό πίνακα, αν η πηγή αλλάζει συνεχώς;
Πώς σχετίζονται οι διαχωρισμοί Spark και οι διαχωρισμοί στους πίνακες (για παράδειγμα, στο Iceberg);
Πείτε μας για τις βέλτιστες πρακτικές χρήσης ευρετηρίων - πότε και πόσο συχνά πρέπει να τα χρησιμοποιείτε.
Τι είναι το Spark JDBC και πώς να φορτώσετε αποτελεσματικά έναν μεγάλο πίνακα μέσω αυτού;
Τι είναι το αρχείο καταγραφής συναλλαγών (WAL) σε ένα σύστημα διαχείρισης βάσεων δεδομένων και γιατί είναι απαραίτητο;
Χρησιμοποιήθηκε η μέθοδος σύγκρισης hashes εγγραφών για τον υπολογισμό της διαφοράς μεταξύ πηγής και πίνακα προορισμού;
Πώς ανιχνεύετε την ανισορροπία δεδομένων (data skew) στο Spark;
Ποιος είναι ο σκοπός του cache και του persist στο Spark;