Machine Learning / AI
Δώστε ένα παράδειγμα για το πώς εντοπίσατε και λύσατε το πρόβλημα των συγκρουόμενων παραδειγμάτων σε ένα πραγματικό έργο.
Ποιες μετρήσεις χρησιμοποιούνται για την αξιολόγηση της ποιότητας της ομαδοποίησης; Πώς επιλέγουμε τον αριθμό των ομάδων;
Ποιες είναι οι επιλογές δειγματοληψίας νέων tokens στο LLM;
Ποια δομή δεδομένων στην Python επιτρέπει το μοντελοποίηση βάσεων δεδομένων NoSQL;
Τι είναι η υπερεκπαίδευση και πώς μπορεί να προληφθεί;
Πόσοι χρήστες ήταν στα έργα;
Μίλησέ μου για τον εαυτό σου στα αγγλικά: περιέγραψε σύντομα τις πιο σημαντικές δεξιότητες και εμπειρίες σου.
Ονομάστε τους κλασικούς τρόπους λήψης ενσωματώσεων λέξεων (Word2Vec, FastText, TF-IDF, N-γράμματα κ.ά.).
Τι είναι το θεώρημα CAP;
Πώς θα λύνατε αυτό το πρόβλημα; Ποια αλγορίθμο/προσέγγιση θα χρησιμοποιούσατε;
Έχεις εμπειρία με RecSys ή LLM;
Περιγράψτε τον αναλυτικό σας πράκτορα: τι έκανε, για ποιον, πώς ήταν η ροή εργασίας του χρήστη;
Ποια θα είναι η τιμή της μετρικής ROC-AUC για έναν ταξινομητή που δίνει πάντα την τιμή 0,9 σε ένα σύνολο δεδομένων που αποτελείται από 90 θετικά και 10 αρνητικά παραδείγματα;
Πώς έγινε η περαιτέρω εκπαίδευση του embedder: με LoRA ή με πλήρη εκπαίδευση;
Πώς εκπαιδεύονται τα μοντέλα ενσωμάτωσης; Πώς θα γράφατε τον δικό σας ενσωματωτή;
Και πώς θα λειτουργούσε θεωρητικά στο boosting αν ο στόχος ήταν minus ένα; Ας υποθέσουμε ότι έχουμε θετικό και αρνητικό, αν θέσουμε στόχο 10 αντί για 1 για το θετικό, τι θα συμβεί, δεν θα αλλάξει τίποτα;
Ποια είναι η διαφορά μεταξύ self-attention στον κωδικοποιητή και στον αποκωδικοποιητή;
Πώς επιλέξατε το όριο 0,6;
Είναι πιο άνετο να επικοινωνείτε με «εσύ» ή με «εσείς»;
Μπορείς να πεις περισσότερα; (για την προστασία του συστήματος RAG από τις ψευδαισθήσεις)