Αναφέρετε την εργασία ρύθμισης αναπαραγωγής που λύσατε.
Data Engineer
Σε ποιες περιπτώσεις εφαρμόζεται η κανονικοποίηση και σε ποιες η αποκανονικοποίηση;
Πώς να αποφύγετε/αφαιρέσετε την προκατάληψη των δεδομένων στο Spark;
Ποιο είναι το αλγόριθμο διάγνωσης και τι πρέπει να κάνετε αν το ερώτημα εξακολουθεί να είναι αργό μετά την προσθήκη πολλαπλών ευρετηρίων;
Τι είναι η κανονικοποίηση και το μοντέλο ER, ποιος είναι ο σκοπός τους;
Μιλήστε για τις βασικές έννοιες του Kafka (ομάδα καταναλωτών, διαμερίσματα, θέματα).
Ποιες είναι οι τυπικές αιτίες που μια ερώτηση σε μια σχεσιακή βάση δεδομένων λειτουργεί αργά;
Ποια μη προφανή προβλήματα μπορεί να προκύψουν κατά τη φόρτωση μεγάλων πινάκων (εκτός από την απόδοση);
Προτείνετε μια λύση για τη τακτική σταδιακή φόρτωση ενός μεγάλου πίνακα με ευέλικτη (αλλαγή) συχνότητα ενημέρωσης από το Postgres στο Data Lake.
Πώς σχετίζονται η ταξινόμηση μέσα στη λειτουργία παραθύρου και η τελική ταξινόμηση ORDER BY στο ερώτημα;
Πώς διαχειρίζεστε τους πόρους μιας εφαρμογής Spark ώστε να μην υπερβαίνετε τη μνήμη κατά την αλλαγή του όγκου των εισερχόμενων δεδομένων;
Πώς να εργαστείτε με διαχωρισμούς μέσω coalesce και repartition;
Ποιες εικόνες Docker έπρεπε να κατασκευάσετε και γιατί;
Υπάρχουν άλλοι μηχανισμοί διαχείρισης shuffle εκτός από coalesce/repartition;
Ποια παράμετροι Spark JDBC χρησιμοποιήθηκαν για την παράλληλη ανάγνωση;