Jak ocenić jakość pracy systemu monitorowania/dochodzenia w sprawie incydentów?
Machine Learning / AI
Jak przechowywać w stanie LangGraph dużą ilość informacji uzyskanych przez API, używać ich wewnątrz narzędzia, ale nie przekazywać zbędnych danych do kontekstu LLM? Na przykład LLM widzi tylko ID i imiona specjalistów, a narzędzie otrzymuje ich harmonogram i dodatkowe dane.
Jak wytrenować LLM, aby nie odpowiadał w przypadku braku informacji w kontekście?
Jak w praktyce sprawić, by model w konkretnym polu generował tylko wartości z krótkiej listy ID tekstowych i żadnych innych symboli?
Co chciałbyś robić ogólnie?
Jak przekazać schemat modelu dla strukturalnego wyjścia na poziomie kodu?
Co można zrobić, jeśli wdrożony agent odpowiada zbyt długo lub brakuje pamięci na umieszczenie LLM?
Opowiedz więcej o pamięci podręcznej KV: jak działa i skąd się bierze, zaczynając od architektury Transformer.
Jak zaimplementowałeś i wdrożyłeś usługę obsługi pull requestów?
Czy orkiestrator widzi wyniki wywołań narzędzi subagenta, czy tylko końcowy output samego subagenta?
Jakie inne metody optymalizacji można zastosować, aby przyspieszyć inferencję lub przynajmniej umieścić model w 12 GB VRAM na RTX 3090?
Jak sprawdzić, czy LLM-as-a-Judge poprawnie ocenia jakość i jak ją skalibrować?
Jak uzyskać sformalizowaną, ustrukturyzowaną odpowiedź, na przykład przy użyciu ustrukturyzowanego wyjścia?
Jak jest zbudowany orkiestrator: jaki framework i architektura są używane, co on robi, czy jest jednokrokowy, czy może wielokrotnie rozważać przed odpowiedzią?
Jakie są opcje próbkowania nowych tokenów w LLM?
Dlaczego zdecydowałeś się odejść z obecnej pracy?
Kto był zaangażowany w strojenie modeli?
Jaki jest obecny skład twojego zespołu?