Sobes.tech

Data Engineer

Πώς μπορεί να διαχειριστεί κανείς το shuffle στο Spark (κατανομή, broadcast join κ.λπ.)?

257

Πώς βρίσκω μια υποακολουθία σε μια συγκεκριμένη στήλη αρχείου καταγραφής στο Linux (π.χ., την ημερομηνία στην τρίτη στήλη);

217

Τι είναι η στατιστική στο πλαίσιο των συστημάτων διαχείρισης βάσεων δεδομένων και της βελτιστοποίησης ερωτημάτων;

217

[όνομα] μίλησε για την εμπειρία του με διάφορα συστήματα διαχείρισης βάσεων δεδομένων, πόσο βαθιά χρειάστηκε να εμβαθύνει στη βελτιστοποίηση και τις εσωτερικές λεπτομέρειες.

201

Λεπτομερώς περιγράψτε τον αλγόριθμο καταγραφής του αυξήματος από την πηγή ώστε να μην χάνεται τίποτα κατά την αλλαγή της συχνότητας φόρτωσης.

197

Πώς οργανώνεται η ανάγνωση ενός ίδιου μηνύματος από το Kafka από πολλούς διαφορετικούς καταναλωτές (fan-out);

196

Πώς να λύσετε το πρόβλημα όταν η διαδικασία ανάγνωσης μπορεί να δει μια ενδιάμεση (μη συνεπή) κατάσταση του πίνακα κατά τη διάρκεια ενός πολύσταδιού ETL (delete+insert) στο Iceberg;

194

Πώς συγκρίνουμε τον αρχικό ("ζωντανό") και τον τελικό πίνακα, αν η πηγή αλλάζει συνεχώς;

193

Πώς σχετίζονται οι διαχωρισμοί Spark και οι διαχωρισμοί στους πίνακες (για παράδειγμα, στο Iceberg);

191

Πείτε μας για τις βέλτιστες πρακτικές χρήσης ευρετηρίων - πότε και πόσο συχνά πρέπει να τα χρησιμοποιείτε.

190

Τι είναι το Spark JDBC και πώς να φορτώσετε αποτελεσματικά έναν μεγάλο πίνακα μέσω αυτού;

189

Τι είναι το αρχείο καταγραφής συναλλαγών (WAL) σε ένα σύστημα διαχείρισης βάσεων δεδομένων και γιατί είναι απαραίτητο;

182

Χρησιμοποιήθηκε η μέθοδος σύγκρισης hashes εγγραφών για τον υπολογισμό της διαφοράς μεταξύ πηγής και πίνακα προορισμού;

180
/2