¿Cómo diseñar un agente que responda a los usuarios basándose en datos de una base de transacciones: qué pila y arquitectura son necesarias, y si vale la pena aplicar la multiagencia?
Machine Learning / AI
¿Qué optimizaciones de inferencia de LLM estándar se pueden proponer si GPT corporativo funciona lentamente?
¿Qué es la decodificación especulativa y cómo acelera la generación?
¿Qué es MoE (Mezcla de Expertos) y por qué esta arquitectura puede ser ventajosa para la inferencia?
Analiza por separado prefill y decode: Q/K/V, formas de matrices y diferencias de fases.
¿Por qué no se debe usar RAG vectorial como mecanismo principal para respuestas en bases de datos transaccionales SQL?
Secuencia de paréntesis correcta Consideremos una secuencia compuesta por paréntesis redondos, cuadrados y llaves '{', '}', '[', ']'. El programa debe determinar si esta secuencia de paréntesis es correcta. - Una secuencia vacía es correcta. - Si A es una secuencia correcta, entonces (A), [A], {A} son correctas. - Si A y B son secuencias correctas, entonces AB es correcta. Formato de entrada: En una sola línea se ingresa la secuencia de paréntesis, que contiene no más de 100000 paréntesis. Formato de salida: Si la secuencia es correcta, el programa debe mostrar 'yes', de lo contrario, 'no'.
Después del ID de token y las incrustaciones, ¿qué exactamente entra en el decodificador: cuál es la forma de las representaciones, cómo se añade la información posicional y qué sucede después?
¿Cuál es la dimensión de salida de la capa MLP?
¿Qué sucede después en el bloque Transformer una vez que la atención ha producido el vector de salida?
¿Qué hicieron con el cumplimiento en el sistema RAG?
¿Qué se hace con los logits antes del muestreo y qué parámetros de muestreo conoces?
¿Cómo es en general el camino de una aplicación ML/LLM desde Dockerfile y código fuente hasta un servicio desplegado y tráfico de usuarios en Kubernetes?
¿Por qué se multiplica el vector Q durante la decodificación y qué se obtiene?
¿Qué temas importantes sobre ti o tu estilo de trabajo te gustaría destacar adicionalmente al gerente?
¿Por qué una LLM cuantificada puede funcionar más rápido y por qué a veces la cuantificación, en cambio, ralentiza la inferencia?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Error para {brackets!r}" f"Se esperaba {expected}, pero se obtuvo {actual}" ) print(f"Todas las pruebas pasaron: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
¿Qué tipos de atención existen que permiten evitar la complejidad cuadrática de la atención completa en contextos largos?
¿Qué se utilizó para limpiar y normalizar los documentos: Redis o regex?
¿Qué IDE o entorno utilizas para trabajar con herramientas de IA?