Machine Learning / AI
Από την άποψη των αναλυτικών εργασιών, τι ήταν; Έχετε αντιμετωπίσει δοκιμές A/B; Ποιες μετρήσεις χρησιμοποιήσατε;
Υπήρξε επανεκπαίδευση του μοντέλου για αυτό το έργο (όχι LLM);
Είχατε επαφή με πελάτες; Σε ποια μορφή;
Άσκηση σε Python: βρείτε το δείκτη του πρώτου μοναδικού χαρακτήρα στη συμβολοσειρά (First Unique Character)
Πείτε μας για τον αλγόριθμο K-means και τις προχωρημένες του εκδοχές (K-means++).
Πες μου περισσότερα για τα συγκεκριμένα αποτελέσματα και έργα στην τρέχουσα εταιρεία.
Έχετε εργαστεί με Spark; Ποια είναι η γενική σας ιδέα για το τι είναι αυτό;
Αν μιλάμε για το ελάχιστο μισθό;
Πώς κλιμακώνετε το σύστημα υπό μεγάλη φόρτωση;
Τι είναι το MoE (Μείγμα Ειδικών) και γιατί αυτή η αρχιτεκτονική μπορεί να είναι επωφελής για την inference;
Υπάρχουν ερωτήσεις σχετικά με τους όρους εργασίας και το έργο;
Τι είναι το MVCC;
Ποια είναι η σειρά εκτέλεσης των τελεστών σε ένα ερώτημα SQL;
Ποια μοντέλα χρησιμοποιήθηκαν σε κάθε στάδιο; Για την εξαγωγή οντοτήτων, για την διανυσματοποίηση, για τη γεννήτρια;
Τι είναι η μέθοδος κύριων συνιστωσών (PCA) και πώς χρησιμοποιείται;
Γιατί μια εργασία στο Spark μπορεί να κολλήσει και να διαρκέσει πολύ;
Τι εννοείς με λάθος (στην προσέγγιση με προτροπή);
Πρακτική άσκηση Το ερώτημα SQL σε 80 εκατομμύρια μηνύματα δημιουργεί διπλότυπα μετά το JOIN. Ποια ενέργεια είναι καλύτερο να ξεκινήσετε πρώτα; - Ελέγξτε την καρδιναλιότητα του JOIN, τα κλειδιά και το σχέδιο εκτέλεσης πριν από την βελτιστοποίηση. - Δημιουργήστε ένα δείκτη σε ένα πεδίο σύνδεσης. - Εξάγετε το αποτέλεσμα σε CSV και διαγράψτε τα διπλότυπα στην Python. - Προσθέστε πάντα το DISTINCT σε όλες τις στήλες. - Προσθέστε το DISTINCT μετά τον έλεγχο του αποτελέσματος σε δείγμα. - Ελέγξτε τα κλειδιά σύνδεσης και την μοναδικότητα και των δύο πινάκων.
Γιατί χρειάζεται η κανονικοποίηση (Layer Norm) — γιατί να σταθεροποιήσουμε την εκπαίδευση;
Πώς διαχειρίζονταν τις αιχμές φόρτωσης στο σύστημα RAG; Τι συνέβαινε υπό υψηλό φόρτο;