Quais são os principais parâmetros que normalmente definimos para tarefas DAG, e por que o gráfico deve ser exatamente assim (lógica de alto nível do DAG)?
Machine Learning / AI
Já trabalhou com Spark? Qual é a sua ideia geral sobre o que é isso?
Dada uma string que contém letras e números. Encontre o maior número que aparece na string (considerando os dígitos consecutivos como um único número).
Quando falamos de métricas em desequilíbrios de classes — quais delas são adequadas e quais não são?
O que acontece no Python ao concatenar strings (por exemplo, current += char)? Por que essa abordagem pode ser ruim nesta tarefa e como otimizar o código para evitar concatenações frequentes de strings?
Já trabalhou com floresta aleatória (no trabalho ou na escola)? Quais são as principais diferenças entre floresta aleatória e boosting?
Como você resolveria o mesmo problema de busca do último clique sem usar JOIN?
Já trabalhou com Airflow ou Spark? Conte-me, o que é um DAG no Airflow, pode dar um exemplo da sua experiência? Você escreveu DAGs você mesmo ou apenas os usou/executou?
Por que a precisão em caso de desequilíbrio de classes mostra um valor de qualidade inadequado?
Tem experiência com séries temporais? Quais métricas são usadas para avaliar a qualidade dos modelos de previsão de séries temporais?
Existem 100 moedas, uma delas é falsa — com duas águias de ambos os lados. Escolhemos uma moeda ao acaso, lançamos e sai uma águia. Qual é a probabilidade de a moeda ser falsa? Explique a solução (usando a fórmula de Bayes).
Dada a tabela logs com eventos de usuários (user_id, item_id, action_type, timestamp). Escreva uma consulta SQL para encontrar o ID do último item que cada usuário clicou.
Se o número ótimo de árvores para o modelo é 500, mas treinámos acidentalmente uma floresta aleatória e um boosting com 1000 árvores, qual dos modelos é mais provável de sobreajustar e por quê?
Por que uma tarefa no Spark pode ficar presa e levar muito tempo?