Wie man einen Agenten entwirft, der auf Basis von Transaktionsdaten auf Benutzeranfragen antwortet: Welche Technologie-Stack und Architektur sind erforderlich, und ist der Einsatz von Multi-Agenten sinnvoll?
Machine Learning / AI
Welche Optimierungen der Inferenz für ein Standard-LLM können vorgeschlagen werden, wenn das Unternehmens-GPT langsam arbeitet?
Was ist spekulatives Decoding und wie beschleunigt es die Generierung?
Was ist MoE (Mixture of Experts) und warum könnte diese Architektur für die Inferenz vorteilhaft sein?
Unterscheide separat zwischen prefill und decode: Q/K/V, Matrizenformen und Phasenunterschiede.
Warum sollte man Vektor-RAG nicht als Hauptmechanismus für Antworten in transaktionalen SQL-Datenbanken verwenden?
Gültige Klammerfolge Betrachten wir eine Sequenz aus runden, eckigen und geschweiften Klammern '{', '}', '[', ']'. Das Programm soll bestimmen, ob diese Klammerfolge korrekt ist. - Eine leere Sequenz ist korrekt. - Wenn A eine korrekte Sequenz ist, dann sind (A), [A], {A} korrekt. - Wenn A und B korrekte Sequenzen sind, dann ist AB korrekt. Eingabeformat: In einer einzigen Zeile wird die Klammerfolge eingegeben, die nicht mehr als 100000 Klammern enthält. Ausgabeformat: Wenn die Sequenz korrekt ist, soll das Programm 'yes' ausgeben, andernfalls 'no'.
Nach Token-ID und Einbettungen, was genau gelangt in den Decoder: Wie ist die Form der Darstellungen, wie wird die Positionsinformation hinzugefügt und was passiert als Nächstes?
Was passiert als Nächstes im Transformer-Block, nachdem die Aufmerksamkeit den Ausgabvektor erzeugt hat?
Wie groß ist die Ausgabedimension der MLP-Schicht?
Was wurde mit der Compliance im RAG-System gemacht?
Was macht man vor dem Sampling mit den Logits und welche Sampling-Parameter kennst du?
Wie verläuft im Allgemeinen der Weg einer ML/LLM-Anwendung vom Dockerfile und Quellcode bis zum bereitgestellten Service und Nutzerverkehr in Kubernetes?
Wird der Q-Vektor beim Decodieren multipliziert und was ergibt sich daraus?
Welche wichtigen Themen über dich oder deinen Arbeitsstil möchtest du dem Vorgesetzten zusätzlich hervorheben?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Fehler für {brackets!r}" f"Wir wollten {expected} bekommen, aber haben {actual}" ) print(f"Alle Tests bestanden: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Welche Arten von Attention gibt es, die die quadratische Komplexität der vollständigen Selbstaufmerksamkeit bei langen Kontexten vermeiden lassen?
Welches IDE oder welche Umgebung verwendest du für die Arbeit mit KI-Tools?
Was wurde zur Reinigung und Normalisierung der Dokumente verwendet: Redis oder regex?
Warum kann eine quantisierte LLM schneller arbeiten und warum verlangsamt Quantisierung manchmal die Inferenz?