O que é supervisão remota (NER de KB)?
Machine Learning / AI
O que é reescrita de consultas em RAG?
O que é o Megatron-LM e qual é a sua abordagem de paralelismo tensorial?
Tem experiência com tarefas de PLN?
Explique a fórmula de atenção por produto escalar escalado. Por que dividir por sqrt(d_k)?
Por que os pesos do modelo podem ficar grandes e por que é necessário reduzi-los com regularização?
Como dividiram a amostra em treino e teste?
Por que é que a regularização ajuda a combater o sobreajuste?
O que é RL baseado em modelos e quais as suas vantagens sobre o sem modelo?
Como escolheram o modelo e os hiperparâmetros, e como ajustaram o limiar de classificação?
Como deve ser a estrutura para treinar um transformador a reconhecer terminologia especializada?
Qual é a diferença entre PR-AUC e ROC-AUC?
Como são calculadas as métricas MAP e MRR em tarefas de classificação?
Qual tarefa é resolvida pelo ajuste do modelo de transformador?
Qual é a diferença entre NaN e None em Python?
Como é visualmente o resultado da decomposição da CNN?
O que deve conter o conjunto de dados de treino para treino com entropia cruzada?
Qual algoritmo está na base do modelo?
O que é a escala NTK-aware RoPE para expandir a janela de contexto?
O que são prompts de recuperação em baixa confiança?