Jak zaprojektować agenta, który odpowiada użytkownikom na podstawie danych z bazy transakcyjnej: jaki stos technologiczny i architektura są potrzebne, i czy warto stosować wieloagentowość?
Machine Learning / AI
Jakie optymalizacje inferencji standardowego LLM można zaproponować, jeśli korporacyjny GPT działa wolno?
Czym jest spekulacyjne dekodowanie i jak przyspiesza generację?
Czym jest MoE (Mieszanka Ekspertów) i dlaczego ta architektura może być korzystna dla inferencji?
Dlaczego nie należy używać wektorowego RAG jako głównego mechanizmu dla odpowiedzi w transakcyjnych bazach danych SQL?
Poprawna sekwencja nawiasów Rozważmy sekwencję składającą się z nawiasów okrągłych, kwadratowych i klamrowych '{', '}', '[', ']'. Program powinien określić, czy dana sekwencja nawiasów jest poprawna. - Pusta sekwencja jest poprawna. - Jeśli A jest poprawną sekwencją, to (A), [A], {A} są poprawne. - Jeśli A i B są poprawnymi sekwencjami, to AB jest poprawne. Format wejścia: W jednej linii podana jest sekwencja nawiasów, zawierająca nie więcej niż 100000 nawiasów. Format wyjścia: Jeśli sekwencja jest poprawna, program powinien wypisać 'yes', w przeciwnym razie 'no'.
Co się dzieje dalej w bloku Transformer po tym, jak uwaga wygenerowała wektor wyjściowy?
Jaka jest wymiarowość wyjścia warstwy MLP?
Rozdzielnie przeanalizuj prefill i decode: Q/K/V, formy macierzy i różnice faz.
Po ID tokena i osadzeniu, co dokładnie trafia do dekodera: jaka jest forma reprezentacji, jak dodawana jest informacja pozycyjna i co się dzieje dalej?
Co zrobiono z zgodnością w systemie RAG?
Jak wygląda ogólnie ścieżka aplikacji ML/LLM od Dockerfile i kodu źródłowego do wdrożonej usługi i ruchu użytkowników w Kubernetes?
Co się robi z logitami przed samplingiem i jakie parametry samplingowe znasz?
Przy dekodowaniu, przez co jest mnożony wektor Q i co się uzyskuje?
Jakie ważne tematy o sobie lub swoim stylu pracy chciałbyś dodatkowo podkreślić przed przełożonym?
Czym wyczyszczono i znormalizowano dokumenty: Redis czy regex?
Dlaczego kwantyzowany LLM może działać szybciej i dlaczego czasami kwantyzacja, przeciwnie, spowalnia inferencję?
Z jakiego IDE lub środowiska korzystasz do pracy z narzędziami AI?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Błąd dla {brackets!r}" f"Oczekiwano {expected}, ale otrzymano {actual}" ) print(f"Wszystkie testy przeszły pomyślnie: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Jakie istnieją rodzaje uwagi, które pozwalają uniknąć kwadratowej złożoności pełnej samouwagi w długim kontekście?