Τηρείται το ACID στο Greenplum;
Data Engineer
Το Data Vault είναι ένα βολικό εργαλείο, αλλά υπάρχουν πολλά αντικείμενα. Μπορείς να εξηγήσεις τη διαφορά μεταξύ hubs, links και satellites;
Ποια διαδικασία ξεκινά όταν διαγράφουμε ή αλλάζουμε εγγραφές στο ClickHouse;
Πώς διαχωρίζουμε το αίτημα σε στάδια; Τι κάνουμε γι' αυτό;
Γνωρίζεις μια βιβλιοθήκη σε Rust, πολυνηματική, πολύ γρήγορη, που μπορεί να αντικαταστήσει το Pandas για Data Science και Big Data;
Ποια είναι η διαφορά μεταξύ CTE και υποερώτησης;
Ποιες τεχνολογίες χρησιμοποιήσατε για να φορτώσετε δεδομένα σε Parquet και ποια μηχανισμοί χρησιμοποιήθηκαν για την απόκτηση και φόρτωση δεδομένων;
Με εξαρτήσεις μεταξύ εργασιών, μεταξύ DAG — χρησιμοποιήσατε αισθητήρες ώστε να ξεκινούν διαδοχικά αρκετές εργασίες;
Έχετε φορτώσει δεδομένα από Spark σε S3 σε μορφή Parquet, και στη συνέχεια από Parquet σε Greenplum — πώς γίνεται η διαδικασία φόρτωσης;
Πώς σχεδίαζες το σχήμα της βάσης δεδομένων; το έκανες χειροκίνητα στη βάση, ή αποθήκευες τα scripts κάπου, ή χρησιμοποιούσες το Liquibase; ποια ήταν η διαδικασία;
Πώς φορτώθηκαν τα δεδομένα από τον εξωτερικό πίνακα στους τελικούς πίνακες;
Πώς έγραψες το DAG του Airflow και τις εργασίες: με το χέρι ή με πρότυπα;
Έχετε δουλέψει με το Git; Τι αποθηκεύατε στο Git;
Με το streaming, λειτουργούσε το Iceberg, άκουσες; Είναι μια αποθήκη αρχείων σκουπίδια.
Αυτό είναι σε πραγματικό χρόνο, πώς να το υλοποιήσουμε ανάμεσα σε Kafka και ClickHouse Spark;
Έχει νόημα να χρησιμοποιείτε CTE αν χρησιμοποιείται μόνο μία φορά στο ερώτημα;
Έχετε εργαστεί άμεσα με το Spark; Ποιο είναι το μειονέκτημά του;
Θα αναλύσουμε JSON — ποιος θα αναλύσει το JSON; Όσο γνωρίζω, στο ClickHouse δεν υπάρχουν συναρτήσεις.
Το Iceberg είναι μια μηχανή που επιτρέπει να κάνεις το S3 βάση δεδομένων, ακόμα και τηρεί το ACID. Ποιο είναι το μειονέκτημά του;
Χρειαζόμαστε μια μηχανή pipeline — έναν μηχανισμό που θα επιτρέπει τη δημιουργία ροών πολύ γρήγορα μέσω της εισαγωγής συμβάσεων και παραμέτρων. Πώς θα το υλοποιούσες σε ανώτερο επίπεδο;