Πώς χρησιμοποιείτε το Python στην εργασία σας και πού αισθάνεστε πιο σίγουροι: στο Python ή στο SQL;
Data Engineer
Υπάρχουν 101 αντικείμενα: 100 αντικείμενα της κλάσης 0 και 1 αντικείμενο της κλάσης 1. Το πρώτο μοντέλο δίνει την ίδια βαθμολογία σε όλα τα αντικείμενα. Ποιο είναι το ROC AUC και το σχήμα της καμπύλης ROC;
Πώς να ελέγξετε μια χρονική σειρά για στασιμότητα;
Δεδομένου ότι ένας αναλυτής έχει γράψει ένα ερώτημα SQL. Εντοπίστε τις αναποτελεσματικότητες στο ερώτημα και προτείνετε πώς να τις αποφύγετε. Το ερώτημα ενώνει δύο πίνακες: - πίνακας γεγονότων 'events' με κλειδί 'event_id' - πίνακας αναφοράς πηγής κυκλοφορίας με κλειδί 'referer_str' Και οι δύο πίνακες περιέχουν δισεκατομμύρια εγγραφές. select * from (select distinct e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name, row_number() over(partition by e.event_id, e.user_id, e.category_id, e.location_id, s.source_name, s.medium_name, s.campaign_name) as rnk from events e left join traffic_source s on e.referer_str = s.referer_str where e.event_date = current_date() - 1 group by 1,2,3,4,5,6,7) t where rnk = 1
Υπάρχει ένας συνεχής στόχος μη αρνητικός και τέσσερα αλγορίθμους: γραμμική παλινδρόμηση, δέντρο αποφάσεων, τυχαίο δάσος και gradient boosting σε δέντρα. Ποιοι από αυτούς μπορούν να παράγουν αρνητικές προβλέψεις;
Τα δεδομένα έχουν φορτωθεί σε έναν πίνακα ReplacingMergeTree; τι θα συμβεί κατά την ανάγνωση αν η συγχώνευση δεν έχει ακόμη πραγματοποιηθεί, και πώς να αποκτήσετε την πιο πρόσφατη έκδοση των εγγραφών;
Τι είναι η denormalization;
Είναι δυνατόν να συνδυάσετε την αφαίρεση διπλοτύπων και την επακόλουθη διαρροή δεδομένων χωρίς τη χρήση ξεχωριστών πινάκων; και αν ναι, πώς;
Τι είναι η δοκιμή υποθέσεων; Ποιες είναι οι τύποι σφαλμάτων τύπου I και II και η p-τιμή;
Ποιες είναι οι δομές δεικτών και πώς λειτουργούν;
Ποιους τρόπους γνωρίζετε για να επιταχύνετε την εκτέλεση εργασιών στο PostgreSQL;
Τι είναι μια σταθερή χρονική σειρά και γιατί είναι σημαντική η σταθερότητα για τα κλασικά μοντέλα;
Τι είναι το bagging και το boosting, και πώς διαφέρουν;
Ποια είναι τα χαρακτηριστικά της χρήσης JOIN κατά την κατασκευή βιτρινών σε PostgreSQL/Greenplum σε σύγκριση με το ClickHouse;
Είστε εξοικειωμένοι με το μοντέλο uplift; Τι γνωρίζετε γι' αυτό;
Πώς να αποτρέψετε την αύξηση του πίνακα αν η αποθήκευση δεδομένων είναι περιορισμένη στον χρόνο, για παράδειγμα δύο χρόνια;
Τι είναι το ROC AUC;
Πρέπει να ελέγξετε αν υπάρχουν πελάτες με πολλαπλά email στον πίνακα. Αν υπάρχουν, διαγράψτε τους (αφήστε μόνο την τελευταία εγγραφή με βάση το create_date).
Τι είναι ένα watermark στο Spark Structured Streaming;
Τι είναι η κανονικοποίηση και πότε εφαρμόζεται;