O que gostaria de fazer em geral?
Machine Learning / AI
O que se pode fazer quando, após um trabalho prolongado, o contexto do agente se enche gradualmente?
Como guardar no estado do LangGraph uma grande quantidade de informações obtidas via API, usá-las dentro da ferramenta, mas sem passar dados desnecessários para o contexto do LLM? Por exemplo, o LLM vê apenas o ID e os nomes dos especialistas, enquanto a ferramenta recebe sua agenda e dados adicionais.
Como se pode avaliar a qualidade do trabalho do sistema de monitorização/investigação de incidentes?
Como treinar um LLM para não responder na ausência de informações no contexto?
Como fazer na prática um modelo num campo específico gerar apenas valores de uma lista curta de IDs de string e nenhum outro símbolo?
O que pode fazer se um agente implantado responder demasiado lentamente ou se não houver memória suficiente para alojar um LLM?
Quem esteve envolvido na afinação dos modelos?
Como passar um esquema de modelo para saída estruturada ao nível do código?
Conte-nos mais sobre o cache KV: como funciona e de onde vem, começando pela arquitetura Transformer.
Como implementou e implantou o serviço para processar pull requests?
O orquestrador vê os resultados das chamadas das ferramentas do subagente ou apenas o output final do próprio subagente?
Que outros métodos de otimização podem ser usados para acelerar a inferência ou pelo menos colocar o modelo em 12 GB de VRAM na RTX 3090?
Como verificar se o LLM-as-a-Judge avalia corretamente a qualidade e como calibrá-lo?
Como é construído o orquestrador: qual o framework e arquitetura utilizados, o que ele faz, é de uma só etapa ou pode raciocinar várias vezes antes de responder?
Como obter uma resposta formalizada e estruturada, por exemplo, ao usar output estruturado?
Quais são as opções de amostragem de novos tokens em LLM?
Qual é a composição atual da sua equipa?