Data Engineer
Για κάθε γραμμή στον πίνακα salaries, εμφανίστε το όνομα του υπαλλήλου, την ημερομηνία, τον μισθό και, χρησιμοποιώντας μια παράθυρη λειτουργία, προσθέστε μια στήλη "μέσος μισθός ανά τμήμα σε αυτήν την ημερομηνία".
Υπάρχει μια έννοια που ονομάζεται επίπεδα απομόνωσης συναλλαγών. Τι γνωρίζετε γι' αυτό;
Πώς σχετίζονται η ταξινόμηση μέσα στη λειτουργία παραθύρου και η τελική ταξινόμηση ORDER BY στο ερώτημα;
print(len(' '.join(map(str, [0, 1]))))
Πώς διαχειρίζεστε τους πόρους μιας εφαρμογής Spark ώστε να μην υπερβαίνετε τη μνήμη κατά την αλλαγή του όγκου των εισερχόμενων δεδομένων;
Τι είναι ο διαχωρισμός και η διανομή (sharding);
Τι είναι ένα "νεκρό ζεύγος" (dead tuple);
dict1 = { (1, 2), [3, 4, 5] : 0 } var = 1, 2
Πρόβλημα #2 Γράψτε ένα ερώτημα που εμφανίζει TOP-3 υπαλλήλους ανά μισθό σε κάθε τμήμα. Εμφανίστε το όνομα του τμήματος, το όνομα του υπαλλήλου και τον μισθό του. πίνακας employee: | id | name | salary | dept_id | |----|-------|--------|---------| | 10 | John | 1000 | 2 | | 20 | Tom | 5000 | 3 | | 30 | Bill | 3000 | 2 | πίνακας department: | id | name | |----|-----------| | 1 | Marketing | | 2 | IT | | 3 | Finance | Έξοδος: department_name, num, employee_name, salary με cte ως( select d.name as department_name, e.name as employee_name, e.salary, dense_rank από employee e ενώ department d on e.id = d.id
Μίλησε για μια ενδιαφέρουσα εργασία στην εταιρεία τα τελευταία 2,5 χρόνια, για παράδειγμα σχετική με το ClickHouse.
Πες ένα παράδειγμα όπου χρησιμοποίησες τεχνητή νοημοσύνη για την αυτοματοποίηση ρουτίνας.
Γιατί επιλέχθηκαν προσαρμοσμένα scripts σε Python/Airflow για το Data Quality αντί για μια έτοιμη μηχανή, όπως το Great Expectations;
Με δικά σου λόγια, τι είναι ένα FULL JOIN;
Τι είναι το CROSS JOIN και ποιο είναι το αποτέλεσμα της εφαρμογής του;
Πώς προσθέτετε ένα κινούμενο μέσο όρο του συνολικού αριθμού παραγγελιών για την τρέχουσα και τις δύο προηγούμενες ημέρες ανά χρήστη;
Πώς λειτουργεί το hash join για πίνακες με 1.000 και 1.000.000 γραμμές;
Αναφέρετε την εργασία ρύθμισης αναπαραγωγής που λύσατε.
Ποια είναι τα μειονεκτήματα των UDF στο Spark και ποιο είναι το μεγαλύτερο μειονέκτημά τους;
Μιλήστε για τις βασικές έννοιες του Kafka (ομάδα καταναλωτών, διαμερίσματα, θέματα).
Έχετε αντιμετωπίσει ποτέ το σφάλμα ClickHouse `Too many parts` κατά την εισαγωγή; Πώς το λύσατε;