Τι είναι το ACID; Τι σημαίνει κάθε γράμμα; Πώς σχετίζεται αυτό με τις συναλλαγές;
Data Engineer
Μίλησε γενικά για τις σχεσιακές βάσεις δεδομένων — τι είναι αυτές;
Ξέρεις το φορμάτ Avro;
Πότε δεν χρειαζόμαστε αποθήκευση δεδομένων;
Έχεις εμπειρία με εικόνες Docker, ρυθμίζοντας περιβάλλον σε εικονική μηχανή;
Αναφέρεις τις διαδικασίες Docker, μπορείς να εξηγήσεις περισσότερα για το πώς είναι οργανωμένο αυτό στην εταιρεία σας;
Τι είναι ο τύπος πάπιας (duck typing);
Ποιοι είναι οι περιορισμοί στη χρήση των κατακερματιστικών πινάκων;
Πώς είναι οργανωμένο το QA σας (έλεγχος ποιότητας δεδομένων);
Ποια είναι η διαφορά μεταξύ ανακατασκευής και βελτιστοποίησης;
Ποιοι είναι οι τύποι φυσικών συνδέσεων (μέθοδοι σύνδεσης);
Έχετε εμπειρία με το Table Engine Join στο ClickHouse;
Τι είναι ένα σχέδιο ερωτήσεων; Ποιος είναι ο σκοπός τους;
Μπορείτε να μου πείτε για την εμπειρία σας με κατανεμημένες βάσεις δεδομένων (Greenplum, ClickHouse);
Τι δεν σου αρέσει αυτήν τη στιγμή στη δουλειά σου;
Έχετε εμπειρία με μηχανές όπως Trino ή με μορφές πινάκων (Iceberg, Parquet) στο Spark;
Υποθέστε ότι το Data Vault δεν είναι διαθέσιμο και υπάρχουν δύο ευρείες πίνακες που πρέπει να ενώσετε. Πώς θα το βελτιστοποιούσατε αυτό στο Greenplum; Και αν ήταν στο ClickHouse;
Μπορεί να σκεφτεί κανείς κάτι άλλο αντί για ένα κανονικό CTE, λαμβάνοντας υπόψη ότι η φιλτράρισμα εξακολουθεί να γίνεται στη μνήμη σε ολόκληρο τον πίνακα;
Για ποιο λόγο χρειαζόσασταν γενικά το Data Vault;
Σε ποιο περιβάλλον ξεκίνησε το Spark;