Data Engineer
Τι συμβαίνει φυσικά κατά τη διάρκεια ενός INSERT, UPDATE και DELETE στο Greenplum; γιατί μετά το DELETE ο χώρος στο δίσκο δεν απελευθερώνεται και ποια είναι η διαφορά μεταξύ DELETE και TRUNCATE;
Πώς θα περιέγραφες στον κώδικα έναν έλεγχο ότι μια τιμή διαφέρει σημαντικά από μια κανονική (αναμενόμενη) κατανομή;
Γιατί μπορεί να χαθούν τα δεδομένα; Δώσε μερικούς λόγους.
Πώς σχετίζονται η ταξινόμηση μέσα στη λειτουργία παραθύρου και η τελική ταξινόμηση ORDER BY στο ερώτημα;
Με ποιες βιβλιοθήκες Python εργάστηκες;
Τι είναι ο διαχωρισμός και η διανομή (sharding);
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Μίλησε για μια ενδιαφέρουσα εργασία στην εταιρεία τα τελευταία 2,5 χρόνια, για παράδειγμα σχετική με το ClickHouse.
Πες ένα παράδειγμα όπου χρησιμοποίησες τεχνητή νοημοσύνη για την αυτοματοποίηση ρουτίνας.
Τι κάνει ο παράμετρος depends_on_past στο Airflow;
Ποια είναι η διαφορά μεταξύ ACID και του θεωρήματος CAP;
Συγκρίνετε τις προσεγγίσεις ETL και ELT: ποια είναι η διαφορά και πότε εφαρμόζεται η καθεμία;
Πώς δούλευαν με το 1C: έπαιρναν δεδομένα απευθείας από τη βάση δεδομένων, μέσω ενός διαύλου ή με άλλο τρόπο;
Έχετε αντιμετωπίσει ποτέ το σφάλμα ClickHouse `Too many parts` κατά την εισαγωγή; Πώς το λύσατε;
Ποια τεχνικά πεδία χρησιμοποιήθηκαν σε satellites, links και hubs Data Vault;
Sual #1 İki cədvəli id atributu üzrə birləşdirərkən inner, left, right, full join ilə neçə qeyd qaytarılacaq? t1 t2 | id | | id | |-----| |-----| | 1 | | 1 | | 2 | | 1 | | 3 | | 3 | | 0 | | 5 | | NULL| | NULL| | NULL| inner: left: right: full outer:
Αποθηκεύσατε τα αποτελέσματα των πίνακων προβολών σε Parquet ή με άλλο τρόπο στο S3;
Πόσο συνολικά εργάστηκες με το Spark και πόσο βαθιά εμβαθύνθηκες σε αυτό;
Γιατί χρειάζονται "φάκελοι"/προθέματα στο S3 εκτός από την ευκολία;
Τι συμβαίνει στο PostgreSQL μετά την εκτέλεση ενός ερωτήματος SELECT * FROM [πίνακας];