Machine Learning / AI
Πώς επηρεάζει η προσθήκη ίδιων τιμών σε όλα τα αντικείμενα τις μετρήσεις ταξινόμησης;
Μπορεί μια συμβολοσειρά να έχει μη τυπικό μήκος;
Ποια γλώσσα προγραμματισμού χρησιμοποιείται για τις αγωγές και τις μικρουπηρεσίες;
Πώς πραγματοποιείται η δοκιμή A/B;
Ποια είναι τα τυπικά σημεία συμφόρησης στην υπηρεσία LLM;
Τι είναι το CDC (καταγραφή αλλαγών δεδομένων) και πού εφαρμόζεται;
Ποια προβλήματα προκύπτουν στην ομαδική inference LLM με διαφορετικά μήκη ερωτημάτων;
Τι είναι η προκατάληψη θέσης στα δεδομένα κλικ;
Πώς φαίνεται η κατανομή των πωλήσεων ενός προϊόντος ανά συχνότητα;
Τι είναι οι κανονικές μορφές και ποιες υπάρχουν;
Ποιες μετρήσεις γνωρίζετε για την αξιολόγηση ενός συστήματος LLM γενικά;
Ποια είναι τα τεχνάσματα των δοκιμών ολοκλήρωσης για τις υπηρεσίες ML;
Τι είναι το DeepSpeed ZeRO Stage 1/2/3;
Ποιες εργασίες επιλύουν τα GNN στην ανίχνευση απάτης;
Πώς θα ρυθμίσουμε τις παραμέτρους στο gradient boosting; Ποιες παράμετροι υπάρχουν και τι θα ρυθμίσεις πρώτα;
Γιατί σκέφτεσαι να φύγεις από την τρέχουσα δουλειά σου;
Πρακτική άσκηση Η τεχνητή νοημοσύνη δημιούργησε κώδικα για την απόφαση σχετικά με την κυκλοφορία ενός νέου LLM. Κάντε μια ανασκόπηση: τροποποιήστε τον έτσι ώστε ο επεξεργαστής να μπορεί να συγκρίνει την ποιότητα των εκδόσεων κατά θεματικά τμήματα, να βλέπει την κατανομή των αξιολογήσεων και να παρατηρεί τον κίνδυνο επιδείνωσης σε μια μικρή ομάδα δεδομένων. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Ποιότητα μοντέλων') plt.ylabel('Μέσος βαθμός') plt.show() print('Καλύτερη έκδοση:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Θέμα: {topic}") plt.suptitle("") plt.ylabel("Βαθμολογία") plt.show() small_groups = stats[stats["count"] < 30] print("Μικρές ομάδες - τα συμπεράσματα δεν είναι αξιόπιστα:") print(small_groups)
Τι είναι το ColBERT και τι είναι η αργή αλληλεπίδραση;
Μετά το ID του token και τα embeddings, τι ακριβώς εισέρχεται στον decoder: ποια είναι η μορφή των αναπαραστάσεων, πώς προστίθεται η πληροφορία θέσης και τι συμβαίνει στη συνέχεια;
Τι είναι το CV-leak και ποια είναι οι πηγές του;