Como projetar um agente que responde aos utilizadores com base nos dados de uma base de transações: qual a pilha e arquitetura necessárias, e se vale a pena aplicar a multiagência?
Machine Learning / AI
Que otimizações de inferência de LLM padrão podem ser sugeridas se o GPT corporativo estiver lento?
O que é decodificação especulativa e como ela acelera a geração?
Qual é a dimensão de saída da camada MLP?
O que é MoE (Mistura de Especialistas) e por que essa arquitetura pode ser vantajosa para a inferência?
O que acontece a seguir no bloco Transformer após a atenção gerar o vetor de saída?
Analise separadamente prefill e decode: Q/K/V, formas de matrizes e diferenças de fases.
Por que não deve usar RAG vetorial como mecanismo principal para respostas em bases de dados SQL transacionais?
Como é geralmente o percurso de uma aplicação ML/LLM desde o Dockerfile e o código fonte até ao serviço implantado e ao tráfego de utilizadores no Kubernetes?
Sequência de parênteses correta Considere uma sequência composta por parênteses redondos, quadrados e chaves '{', '}', '[', ']'. O programa deve determinar se essa sequência de parênteses está correta. - Uma sequência vazia é correta. - Se A é uma sequência correta, então (A), [A], {A} são corretas. - Se A e B são sequências corretas, então AB é correta. Formato de entrada: Em uma única linha, insira a sequência de parênteses, contendo no máximo 100000 parênteses. Formato de saída: Se a sequência estiver correta, o programa deve exibir 'yes', caso contrário, 'no'.
Após o ID do token e as embeddings, o que exatamente entra no decodificador: qual é a forma das representações, como a informação posicional é adicionada e o que acontece a seguir?
O que fizeram com a conformidade no sistema RAG?
O que se faz com os logits antes do sampling e quais os parâmetros de sampling que conheces?
Por que o vetor Q é multiplicado durante o decodificador e o que se obtém?
Que temas importantes sobre si ou seu estilo de trabalho gostaria de destacar adicionalmente ao gerente?
O que foi usado para limpar e normalizar os documentos: Redis ou regex?
Que IDE ou ambiente você usa para trabalhar com ferramentas de IA?
Por que a LLM quantizada pode funcionar mais rapidamente e por que às vezes a quantização, pelo contrário, desacelera a inferência?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Erro para {brackets!r}" f"Queríamos obter {expected}, mas obtivemos {actual}" ) print(f"Todos os testes passaram: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Quais são os tipos de atenção que permitem evitar a complexidade quadrática da atenção total ao longo de um contexto longo?