O que é o operador HAVING em SQL? Onde é que ele é utilizado?
Machine Learning / AI
Tarefa de regressão: previsão do preço das ações no 5º ano usando dados dos 4 anos anteriores com boosting. Que erro cometemos?
O que são as métricas MAPE e SMAPE? Onde podem ser ineficazes?
Fale-nos sobre o projeto de avaliação da qualidade do trabalho dos despachantes: quais modelos foram utilizados, como foram comparados com o roteiro de referência?
Por que usar CatBoost e não XGBoost ou LightGBM? Quais são as diferenças?
Tarefa MVP: classificação binária com desequilíbrio de classes, os dados estão distribuídos em 10 máquinas, há uma característica textual. Que abordagem sugeriria?
Fale sobre o projeto de clusterização de solicitações com marcação por importância de negócio.
Quais métricas são mais prioritárias em caso de grande desequilíbrio de classes (99 para 1)?
Conhece os protocolos HTTP, UDP, TLS?
Qual é a principal diferença entre Spark e Pandas? O que é Hadoop?
Sabes o que é bagging? Dá um exemplo de algoritmo.
O que é LoRA (Low-Rank Adaptation)?
Fale sobre o algoritmo K-means e seus variantes avançadas (K-means++).
Conte-me mais sobre o projeto de previsão de rotatividade de funcionários: o que fizeram, quais dados usaram, por que escolheram o CatBoost?
Fale sobre si mesmo, sua experiência e projetos.
Quais métricas são usadas para avaliar a qualidade do clustering? Como escolher o número de clusters?