Como determinar se o modelo de embeddings está a funcionar bem? Quais métricas foram utilizadas?
Machine Learning / AI
Podes explicar a diferença entre cross-encoder e bi-encoder?
Fala-me sobre a quantificação de modelos: o que é, para que serve, que tipos existem?
Existe alguma forma de verificar se o texto gerado não contém erros factuais em relação ao original?
Como foram extraídos os dados de documentos PDF para o sistema RAG?
Como foi escolhida a estratégia de chunking para o sistema RAG?
Como testar um serviço implementado no FastAPI?
Fala-me sobre as métricas de desempenho do serviço de ML: latência, RPS, como foi organizado no teu projeto?
Fale sobre bancos de dados vetoriais, quais existem, em que se diferenciam, por que escolheram o pgvector?
Fale sobre os parâmetros de geração de LLM: temperatura, top-k, top-p e outros.
Como se relacionam Recall e Precision, é possível aumentar um sem diminuir o outro? Dê exemplos de tarefas.
Fale sobre a tarefa mais difícil ou dificuldade em um dos projetos.
Como avaliar a qualidade da sumarização?
Como foram organizados os dados para a sumarização de diálogos e como ocorreu o treino?
Qual método de quantificação (int8 ou float) prejudicará menos a qualidade do modelo?
Como abordarias a tarefa de resumir um diálogo de várias pessoas numa conferência (por exemplo, 10 desenvolvedores no Slack)?
Qual modelo e abordagem escolher para processar áudio de uma conferência (fala-para-texto, diarização)?
Fala-me sobre LoRA: o que é, para que serve?
Por que escolheram a busca híbrida BM25 + embeddings em vez de apenas a distância do cosseno?
Como trabalhar com dados privados durante a implantação local do sistema?