Ποια είναι τα βασικά παράμετροι που συνήθως ορίζουμε για τις εργασίες DAG και γιατί το γράφημα πρέπει να είναι ακριβώς έτσι (ανώτερη λογική του DAG);
Machine Learning / AI
Έχετε εργαστεί με Spark; Ποια είναι η γενική σας ιδέα για το τι είναι αυτό;
Όταν μιλάμε για μετρήσεις σε ανισορροπία κλάσεων — ποιες είναι κατάλληλες και ποιες όχι;
Δίνεται μια συμβολοσειρά που περιέχει γράμματα και αριθμούς. Βρείτε το μέγιστο αριθμό που εμφανίζεται στη συμβολοσειρά (θεωρώντας διαδοχικούς αριθμούς ως ενιαίο αριθμό).
Τι συμβαίνει στην Python κατά την σύνδεση συμβολοσειρών (π.χ., current += char); Γιατί αυτή η προσέγγιση μπορεί να είναι προβληματική σε αυτήν την εργασία και πώς μπορούμε να βελτιστοποιήσουμε τον κώδικα αποφεύγοντας συχνές συνενώσεις συμβολοσειρών;
Πώς θα λύνατε το ίδιο πρόβλημα αναζήτησης του τελευταίου κλικ χωρίς χρήση JOIN;
Έχετε αντιμετωπίσει ποτέ τυχαίο δάσος (στη δουλειά ή στο σχολείο); Ποιες είναι οι βασικές διαφορές μεταξύ τυχαίου δάσους και boosting;
Έχετε δουλέψει με Airflow ή Spark; Πείτε μου, τι είναι ένα DAG στο Airflow, μπορείτε να δώσετε ένα παράδειγμα από την εμπειρία σας; Έχετε γράψει εσείς DAGs ή απλώς τα χρησιμοποιήσατε/εκτελέσατε;
Έχετε εμπειρία με χρονικές σειρές; Ποιες μετρήσεις χρησιμοποιούνται για την αξιολόγηση της ποιότητας των μοντέλων πρόβλεψης χρονικών σειρών;
Γιατί η ακρίβεια σε περίπτωση ανισορροπίας των κατηγοριών δείχνει μια αναξιόπιστη τιμή ποιότητας;
Δεδομένου του πίνακα logs με γεγονότα χρηστών (user_id, item_id, action_type, timestamp). Γράψτε ένα ερώτημα SQL για να βρείτε το ID του τελευταίου αντικειμένου που κλικάρει κάθε χρήστης.
Υπάρχουν 100 νομίσματα, ένα από αυτά είναι ψεύτικο — με δύο αετούς και στις δύο πλευρές. Επιλέγουμε τυχαία ένα νόμισμα, το ρίχνουμε και εμφανίζεται αετός. Ποια είναι η πιθανότητα το νόμισμα να είναι ψεύτικο; Εξηγήστε τη λύση (χρησιμοποιώντας τον τύπο του Bayes).
Αν ο βέλτιστος αριθμός δέντρων για το μοντέλο είναι 500, αλλά τυχαία εκπαιδεύσαμε τόσο ένα τυχαίο δάσος όσο και ένα boosting με 1000 δέντρα, ποιο από τα μοντέλα είναι πιο πιθανό να υπερεκπαιδευτεί και γιατί;
Γιατί μια εργασία στο Spark μπορεί να κολλήσει και να διαρκέσει πολύ;