Não se importa de tentar fazer uma entrevista com IA?
Machine Learning / AI
Qual é o nível de rendimento mínimo e confortável para si em rublos?
Qual é a sua formação superior e área de estudo?
Tem alguma questão sobre as condições de colaboração?
Por que está considerando uma nova proposta agora?
Como visualizaria os outliers nas avaliações temáticas para entender o seu impacto na imagem geral?
Como exatamente o BatchNorm usa as estatísticas guardadas no modo `eval()` e por que isso é importante para a estabilidade dos resultados?
Como avalia o seu nível?
Um dia antes de comparar duas versões de LLM, descobriu-se que o código do experimento no ramo está presente, mas a versão exata dos dados e os parâmetros LoRA não estão fixados. O que você escolheria como o primeiro incremento para os próximos dois dias e do que estaria disposto a abrir mão conscientemente?
Tarefa prática A verificação do LLM no PyTorch dá resultados diferentes em duas execuções. Qual é a solução mais madura? - Ativar eval() e comparar os resultados novamente. - Aumentar o tamanho do conjunto de teste. - Repetir a execução e escolher o melhor resultado. - Mudar para TensorFlow sem analisar a causa. - Fixar a seed e considerar o problema resolvido. - Verificar eval(), no_grad(), seed, DataLoader e operações CUDA determinísticas.
Dê um exemplo de como identificou e resolveu um problema de exemplos conflitantes em um projeto real.
Tarefa prática A IA gerou um código para decidir sobre o lançamento de um novo LLM. Faça uma revisão: modifique-o para que o editor possa comparar a qualidade das versões por segmentos temáticos, ver a dispersão das avaliações e notar o risco de deterioração em um pequeno grupo de dados. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Qualidade dos modelos') plt.ylabel('Avaliação média') plt.show() print('Melhor versão:', summary.idxmax())
Está disposto a considerar projetos de meio período e combinações de trabalho?
Tarefa prática A IA gerou um código para a decisão sobre o lançamento de um novo LLM. Faça uma revisão: modifique-o para que o editor possa comparar a qualidade das versões por segmentos temáticos, ver a dispersão das avaliações e notar o risco de deterioração em um pequeno grupo de dados. import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') summary = scores.groupby('model_version')['score'].mean() plt.bar(summary.index, summary.values) plt.title('Qualidade dos modelos') plt.ylabel('Avaliação média') plt.show() print('Melhor versão:', summary.idxmax()) --- import matplotlib.pyplot as plt import pandas as pd scores = pd.read_csv('model_scores.csv') stats = ( scores.groupby(["topic", "model_version"])["score"] .agg(["mean", "std", "count"]) .reset_index() ) print(stats) for topic, group in scores.groupby("topic"): group.boxplot(column="score", by="model_version") plt.title(f"Tema: {topic}") plt.suptitle("") plt.ylabel("Avaliação") plt.show() small_groups = stats[stats["count"] < 30] print("Grupos pequenos - conclusões pouco confiáveis:") print(small_groups)
Conte-nos, como foi o formato da entrevista: o que gostou e o que gostaria de melhorar.
Quais são as suas preferências ou restrições em relação a projetos e áreas temáticas?
Como garante a proveniência dos resultados do experimento para poder entender exatamente de onde vêm as métricas?
Tarefa prática A pontuação média do novo LLM aumentou, mas os editores reclamam das respostas financeiras. Qual gráfico apoiará melhor a decisão de lançamento? Um indicador principal da pontuação média. Colunas com a pontuação média de todos os temas. Caixas com bigodes por temas e versões do modelo. Tabela de pontuações médias por temas. Nuvem de palavras das novas respostas. Distribuições de pontuações por versões e temas com o tamanho de cada grupo.
Como costuma verificar a qualidade e relevância dos dados antes de treinar o LoRA?
Quando estará pronto para iniciar o projeto?