Non ti dispiace provare a fare un colloquio con l'IA?
Machine Learning / AI
Qual è il livello di reddito minimo e confortevole per te in rubli?
Perché stai considerando una nuova proposta ora?
Qual è il suo titolo di studio superiore e il campo di studi?
Come esattamente BatchNorm utilizza le statistiche salvate in modalità `eval()` e perché è importante per la stabilità dei risultati?
Hai domande sulle condizioni di collaborazione?
Come visualizzeresti le deviazioni nelle valutazioni tematiche per capire quanto influenzano il quadro generale?
Compito pratico La verifica di LLM in PyTorch dà risultati diversi in due esecuzioni. Qual è la soluzione più matura? - Attivare eval() e confrontare di nuovo i risultati. - Aumentare la dimensione del set di verifica. - Ripetere l'esecuzione e scegliere il miglior risultato. - Passare a TensorFlow senza analizzare la causa. - Fissare seed e considerare il problema risolto. - Verificare eval(), no_grad(), seed, DataLoader e operazioni CUDA deterministiche.
Ci racconti come le è sembrato il formato del colloquio: cosa le è piaciuto e cosa vorrebbe migliorare.
Esercizio pratico L'IA ha generato un codice per la decisione sul rilascio di un nuovo LLM. Effettua una revisione: modificalo in modo che l'editor possa confrontare la qualità delle versioni per segmenti tematici, vedere la dispersione delle valutazioni e notare il rischio di deterioramento in un piccolo gruppo di dati. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Qualità dei modelli') plt.ylabel('Valutazione media') plt.show() print('Migliore versione:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Tema: {topic}") plt.suptitle("") plt.ylabel("Valutazione") plt.show() small_groups = stats[stats["count"] < 30] print("Piccoli gruppi - le conclusioni sono poco affidabili:") print(small_groups)
Fornisci un esempio di come hai identificato e risolto un problema di esempi in conflitto in un progetto reale.
Esercizio pratico L'IA ha generato un codice per decidere il rilascio di un nuovo LLM. Effettua una revisione: modificalo in modo che l'editor possa confrontare la qualità delle versioni per segmenti tematici, vedere la dispersione delle valutazioni e notare il rischio di deterioramento in un piccolo gruppo di dati. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Qualità dei modelli') plt.ylabel('Punteggio medio') plt.show() print('Migliore versione:', summary.idxmax())
Come garantisci l'origine dei risultati dell'esperimento per poter capire esattamente da dove provengono le metriche?
Sei disposto a considerare progetti part-time e combinazioni di lavoro?
Come ti valuti?
Come gestisci di solito le versioni dei dati e dei modelli in tali esperimenti?
Ci sono attualmente colloqui presso grandi aziende tecnologiche come Yandex o Alfa?
Un giorno prima del confronto tra due versioni di LLM, è stato scoperto che il codice dell'esperimento nel ramo è presente, ma la versione esatta dei dati e i parametri LoRA non sono fissati. Cosa sceglieresti come primo incremento per i prossimi due giorni e a cosa saresti disposto a rinunciare consapevolmente?
Compito pratico Quale insieme di artefatti consente di riprodurre onestamente il confronto di due esecuzioni di LoRA? - Solo la tabella finale di qualità. - Commit con codice e screenshot della metrica finale. - Codice e file di configurazione dell'esperimento. - Codice, hash dei dati, modello di base, configurazione di LoRA, dipendenze e comando di avvio. - Solo link al branch Git. - Codice, parametri di LoRA, versione del modello di base e dipendenze.
Fornisci un esempio in cui un uso scorretto di BatchNorm in modalità `eval()` ha portato a errori nelle previsioni.