Como funciona a tokenização? Porque é que se usam subword tokens em vez de palavras inteiras?
Machine Learning / AI
Fale sobre BGE-M3: três representações — denso, esparso, multi-vetor.
O que são Recall e Precision? Problema: 50 frutas, 30 maçãs e 20 peras, um robô encontrou corretamente 20 maçãs, mas confundiu 15 peras com maçãs. Calcule as métricas.
Está familiarizado com LoRA e métodos de fine-tuning?
Como foram selecionados os coeficientes para a pesquisa híbrida?
Por que precisou de 12.000 pares de pergunta-resposta se havia apenas 15 modelos?
Por que você reconheceu os documentos como imagens em vez de criar um analisador?
Como você formou o conjunto de dados de teste: das mesmas 12 mil pares ou de novos dados?
Fale-nos sobre a clusterização: qual problema resolveram, qual método usaram, como mediram a qualidade?
Como funciona um transformador? Fale-me sobre BERT e GPT.
O que é um vetor denso (embedding denso)? Como é obtido? Qual é o seu tamanho?
Que modelos foram utilizados em cada etapa? Para a extração de entidades, para a vetorização, para a geração?
Como avaliou a qualidade do sistema RAG? Quais métricas utilizou?
O que é um cross-encoder e onde o utilizou?
Por que é necessário reduzir o tamanho do dicionário? O que há de errado com um dicionário grande? Em qual função ocorre a carga?
O que era enviado ao utilizador final no seu sistema?
O que é um vetor esparso? Como ele difere de um vetor denso?
Qual é a diferença entre pedidos GET e POST?
Explique de forma simples como funciona o seu sistema para um utilizador, sem assíncronia.
Para uma consulta, basta uma das 12 mil respostas ou várias?