Как да проектираме агент, който отговаря на потребителя въз основа на данни от транзакционна база: какъв стек и архитектура са необходими, и дали си струва да се прилага мултиагентност?
Machine Learning / AI
Какви оптимизации на инференса на стандартен LLM могат да бъдат предложени, ако корпоративният GPT работи бавно?
Какво е спекулативно декодиране и как ускорява генерирането?
Какво е MoE (Микс от експерти) и защо тази архитектура може да бъде изгодна за inference?
Какъв е размерът на изхода на слоя MLP?
Какво се случва след това в Transformer блока, след като вниманието е дал изходния вектор?
Защо не трябва да се използва векторен RAG като основен механизъм за отговори в транзакционните SQL бази данни?
Разгледайте отделно prefill и decode: Q/K/V, форми на матрици и разлики във фазите.
Правилна последователност от скоби Нека разгледаме последователност, състояща се от кръгли, квадратни и фигурни скоби '{', '}', '[', ']'. Програмата трябва да определи дали тази последователност от скоби е правилна. - Празната последователност е правилна. - Ако A е правилна последователност, тогава (A), [A], {A} са правилни. - Ако A и B са правилни последователности, тогава AB е правилна. Формат на въвеждане: В една единствена линия е записана последователност от скоби, съдържаща не повече от 100000 скоби. Формат на извеждане: Ако последователността е правилна, програмата трябва да изведе 'yes', иначе 'no'.
Как протича общият път на ML/LLM приложение от Dockerfile и изходния код до разгръщания сервис и потребителски трафик в Kubernetes?
След идентификатора на токена и вграждания, какво точно постъпва в декодера: каква е формата на представянията, как се добавя позиционната информация и какво се случва след това?
Какво направиха с съответствието в системата RAG?
Какво се прави с логитите преди сэмплиране и какви параметри за сэмплиране знаеш?
С кое се умножава Q-векторът при декодиране и какво се получава?
Кои важни теми за вас или вашия стил на работа бихте искали допълнително да подчертаете пред ръководителя?
Каква IDE или среда използвате за работа с AI инструменти?
Какво беше използвано за почистване и нормализиране на документите: Redis или regex?
Защо квантализираният LLM може да работи по-бързо и защо понякога квантизацията, напротив, забавя инференса?
import unittest class Solution: def isvalid(self, s:str) -> bool: matching_brackets = { ")": "(", "]": "[", "}": "{", } stack: list[str] = [] for bracket in s: if bracket in "([{": stack.append(bracket) continue if bracket not in matching_brackets: return False if not stack or stack[-1] != matching_brackets[bracket]: return False stack.pop() return not stack class SolutionTest: def __init__(self): self.Solution = Solution() def run(self): test_cases = [ ("", True), ("()", True), ("(){}[]", True), ("(({}))", True), ("(", False), (")", False), ("(((", False), ("{[]}", False), ] for brackets, expected in test_cases: actual = self.Solution.isvalid(brackets) assert actual == expected, ( f"Грешка за {brackets!r}" f"Очаквахме {expected}, но получихме {actual}" ) print(f"Всички тестове преминаха успешно: {len(test_cases)}") if __name__ == "__main__": SolutionTest().run()
Кои видове внимание съществуват, които позволяват да се избегне квадратичната сложност на пълното самостоятелно внимание при дълъг контекст?