Comment concevoir un agent qui répond aux utilisateurs en se basant sur les données d'une base transactionnelle : quelle pile technologique et architecture sont nécessaires, et faut-il utiliser la multi-agence ?
Machine Learning / AI
Quelles optimisations d'inférence pour un LLM standard peuvent être proposées si le GPT d'entreprise fonctionne lentement?
Qu'est-ce que la décodification spéculative et comment accélère-t-elle la génération?
Qu'est-ce que MoE (Mélange d'Experts) et pourquoi cette architecture peut-elle être avantageuse pour l'inférence?
Analyse séparément prefill et decode : Q/K/V, formes de matrices et différences de phases.
Pourquoi ne pas utiliser RAG vectoriel comme mécanisme principal pour les réponses dans une base de données SQL transactionnelle?
Séquence de parenthèses correcte Considérons une séquence composée de parenthèses rondes, carrées et accolées '{', '}', '[', ']'. Le programme doit déterminer si cette séquence de parenthèses est correcte. - Une séquence vide est correcte. - Si A est une séquence correcte, alors (A), [A], {A} sont corrects. - Si A et B sont des séquences correctes, alors AB est correct. Format d'entrée: Une seule ligne contenant la séquence de parenthèses, ne dépassant pas 100000 caractères. Format de sortie: Si la séquence est correcte, le programme doit afficher 'yes', sinon 'no'.
Après l'ID du token et les embeddings, qu'est-ce qui arrive exactement dans le décodeur : quelle est la forme des représentations, comment l'information positionnelle est-elle ajoutée et que se passe-t-il ensuite ?
Que se passe-t-il après dans le bloc Transformer une fois que l'attention a produit le vecteur de sortie?
Quelle est la dimension de sortie de la couche MLP?
Que faisait-on avec la conformité dans le système RAG?
Que fait-on avec les logits avant l'échantillonnage et quels paramètres d'échantillonnage connais-tu?
Comment se déroule généralement le parcours d'une application ML/LLM depuis le Dockerfile et le code source jusqu'au service déployé et au trafic utilisateur dans Kubernetes?
Par quoi le vecteur Q est-il multiplié lors du décodage et qu'obtient-on ?
Quels sujets importants à propos de vous ou de votre style de travail aimeriez-vous mettre en avant auprès du responsable?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Erreur pour {brackets!r}" f"On voulait obtenir {expected}, mais on a obtenu {actual}" ) print(f"Tous les tests ont réussi : {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Quels sont les types d'attention qui permettent d'éviter la complexité quadratique de l'attention complète sur de longs contextes?
Quel IDE ou environnement utilisez-vous pour travailler avec des outils d'IA?
Qu'est-ce qui a été utilisé pour nettoyer et normaliser les documents : Redis ou regex ?
Pourquoi une LLM quantifiée peut-elle fonctionner plus rapidement et pourquoi parfois la quantification, au contraire, ralentit-elle l'inférence?