Forneça um exemplo em que o uso incorreto do BatchNorm no modo `eval()` levou a erros nas previsões.
Machine Learning / AI
Após a nova versão do modelo, a avaliação média de qualidade aumentou, mas os editores dizem que as respostas sobre temas jurídicos e financeiros ficaram significativamente piores. Qual visualização você faria primeiro para decidir se deve parar a publicação?
Tarefa prática Qual conjunto de artefatos permite reproduzir honestamente a comparação de duas execuções do LoRA? - Apenas a tabela final de qualidade. - Commit com código e captura de tela da métrica final. - Código e arquivo de configuração do experimento. - Código, hash dos dados, modelo base, configuração do LoRA, dependências e comando de execução. - Apenas link para o branch do Git. - Código, parâmetros do LoRA, versão do modelo base e dependências.
Como costuma gerir as versões de dados e modelos nesses experimentos?
Existem entrevistas atuais em grandes empresas de tecnologia, como Yandex ou Alfa?
Tarefa prática A consulta SQL a 80 milhões de mensagens cria duplicados após o JOIN. Qual ação é melhor começar primeiro? - Verificar a cardinalidade do JOIN, as chaves e o plano de execução antes de otimizar. - Criar um índice em um campo de junção. - Exportar o resultado para CSV e remover duplicados em Python. - Sempre adicionar DISTINCT a todas as colunas. - Adicionar DISTINCT após verificar o resultado na amostra. - Verificar as chaves de junção e a unicidade de ambas as tabelas.
Planeja ficar nas Filipinas ou mudar-se para outro país?
Pode contar-me mais detalhes sobre o que exatamente lhe pareceu "asfixiante" nas perguntas e como isso afetou a sua perceção da entrevista?
Tem experiência de trabalho em equipas totalmente anglófonas?
Tem experiência em entrevistas com IA?
Tem propostas em mãos ou etapas finais noutras empresas?
Como avaliaria quantitativamente o impacto das emissões nas métricas do modelo, como a precisão ou a pontuação F1?
Como otimizaria os índices nas chaves de junção para reduzir duplicados e acelerar a consulta?
Imagine que estás a trabalhar com um modelo em PyTorch e, após convertê-lo para o modo de avaliação eval(), vês que as métricas num conjunto de teste fixo de 10.000 exemplos mudam a cada execução. Fixas o estado inicial dos geradores de números aleatórios para reprodutibilidade: onde mais pode estar escondido a fonte das mudanças? Explica o papel do Dropout, BatchNorm e torch.no_grad() e nomeia as métricas com limites pelos quais verificarás a estabilidade dos resultados.
Tarefa prática A IA sugere treinar LoRA em todos os 2 milhões de diálogos não limpos. Qual é a resposta mais madura do candidato? - Confiar na IA: um grande corpus compensará os erros. - Primeiro alterar o prompt sem modificar os dados. - Treinar LoRA na parte limpa e compará-la com o modelo base. - Verificar uma amostra aleatória de marcações antes do treinamento. - Primeiro verificar os dados e a qualidade por tópicos em um conjunto separado, depois treinar LoRA de forma limitada. - Treinar em todo o corpus, mas reduzir o rango do LoRA.
Avalie o seu inglês separadamente para leitura/escrita e conversação de acordo com os níveis CEFR.
Como exatamente você usaria `EXPLAIN` para identificar problemas de desempenho nesta consulta?
Qual formato de formalização é mais conveniente para si: GPH, IP ou TК?
Na tabela de diálogos há 80 milhões de mensagens, e a consulta analítica para o conjunto de avaliação demora 25 minutos e às vezes retorna pares de pergunta-resposta duplicados. O que você corrigiria primeiro e por quê?
Para gerar perguntas, o grande modelo de linguagem tem dificuldades em manter o estilo em temas raros. O assistente de IA sugere lançar imediatamente LoRA em todo o corpus histórico de 2 milhões de diálogos, mas a marcação é parcialmente ruidosa. Em que casos você não confiaria nesse conselho e o que escolheria primeiro?