Pode ocorrer uma condição de corrida no código assíncrono Python?
Python
Quantos documentos foram recuperados na pesquisa? Houve re-ranking?
Como funcionava o cache semântico no Redis?
Como foi avaliada a qualidade do trabalho do sistema RAG?
Como monitorizaste o funcionamento do serviço? O que viste no Grafana?
O que mais pode ser otimizado no método predict? (criação de DataFrame a cada vez)
Por que é melhor usar POST em vez de GET para este endpoint?
Escrever um serviço web no FastAPI que aceite uma requisição POST com dados (renda, idade, valor do empréstimo) e retorne a previsão do modelo ML (aprovação do empréstimo)
Como otimizar o serviço para que uma tarefa síncrona de CPU (modelo de previsão) não bloqueie o event loop do FastAPI?
Fale-me de todo o pipeline do sistema RAG: quais documentos foram usados, como foram carregados e processados?
O que é Singleton e como aplicá-lo para carregar um modelo? Quais são as desvantagens do Singleton?
Quanto tempo levou toda a pipeline RAG desde o pedido até à resposta?
Como os documentos foram carregados na base de dados vetorial? Como ocorreu o chunking?
Qual é o problema que surge e como resolvê-lo se um serviço assíncrono usa um modelo ML local (por exemplo, um reranker) que é chamado de forma síncrona?
Como foram obtidos os embeddings? Através de qual modelo e como foi executado?
Como funciona a multitarefa em Python tendo em conta o GIL? Em que os threads diferem dos processos?