Cum să proiectezi un agent care răspunde utilizatorilor pe baza datelor dintr-o bază tranzacțională: ce stivă și arhitectură sunt necesare, și dacă merită să aplici multiagentul?
Machine Learning / AI
Ce optimizări ale inferenței pentru LLM standard pot fi sugerate dacă GPT-ul corporativ funcționează lent?
Ce este decodarea speculativă și cum accelerează generarea?
Ce este MoE (Amestec de Experți) și de ce această arhitectură poate fi benefică pentru inferență?
Secvență corectă de paranteze Să considerăm o secvență formată din paranteze rotunde, pătrate și acolade '{', '}', '[', ']'. Programul trebuie să determine dacă această secvență de paranteze este corectă. - O secvență goală este corectă. - Dacă A este o secvență corectă, atunci (A), [A], {A} sunt corecte. - Dacă A și B sunt secvențe corecte, atunci AB este corect. Formatul de intrare: Se introduce o singură linie cu secvența de paranteze, care conține cel mult 100000 de paranteze. Formatul de ieșire: Dacă secvența este corectă, programul trebuie să afișeze 'yes', altfel 'no'.
Analizează separat prefill și decode: Q/K/V, formele matricelor și diferențele de fază.
De ce nu ar trebui să folosiți RAG vectorial ca mecanism principal pentru răspunsuri în bazele de date SQL tranzacționale?
După ID-ul tokenului și embeddings, ce anume intră exact în decoder: care este forma reprezentărilor, cum se adaugă informația pozițională și ce se întâmplă apoi?
Care este dimensiunea de ieșire a stratului MLP?
Ce se întâmplă după ce atenția a dat vectorul de ieșire în blocul Transformer?
Ce s-a făcut cu conformitatea în sistemul RAG?
Ce se face cu logits înainte de sampling și ce parametri de sampling cunoști?
Cum se desfășoară în general drumul unei aplicații ML/LLM de la Dockerfile și codul sursă până la serviciul implementat și traficul utilizatorilor în Kubernetes?
Cu ce se înmulțește vectorul Q în timpul decodificării și ce se obține?
Ce subiecte importante despre tine sau stilul tău de lucru ai dori să evidențiezi suplimentar pentru manager?
De ce poate funcționa mai rapid LLM-ul cuantificat și de ce uneori cuantizarea, dimpotrivă, încetinește inferența?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Eroare pentru {brackets!r}" f"Se astepta {expected}, dar s-a primit {actual}" ) print(f"Toate testele au trecut: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Ce tipuri de atenție există pentru a evita complexitatea pătratică a auto-atenției complete într-un context lung?
Ce s-a folosit pentru curățarea și normalizarea documentelor: Redis sau regex?
Ce IDE sau mediu folosești pentru a lucra cu instrumente AI?