Middle — Senior
Jak ukládat do mezipaměti nejčastější dotazy v RAG?
sobes.tech AI
Odpověď od AI
V Generaci Aumentované o Vyhledávání (RAG) pomáhá ukládání často kladených dotazů do mezipaměti snížit zpoždění a zatížení vektorové databáze a generativního modelu. Hlavní přístupy:
-
Ukládání výsledků vyhledávání: ukládejte výsledky vyhledávání do vektorové databáze pro často opakované dotazy. Při opětovném dotazu vraťte uložené dokumenty bez opětovného vyhledávání.
-
Ukládání vygenerovaných odpovědí: pokud se dotaz a kontext shodují, lze vrátit dříve vygenerovanou odpověď.
-
Použití TTL (time-to-live): aby cache nezestárla, nastavte dobu života pro uložená data.
-
Hashování dotazů: pro rychlé vyhledávání v cache na základě klíče odvozeného od hashe dotazu.
Příklad v Pythonu s jednoduchým slovníkem jako cache:
cache = {}
def get_rag_response(query):
key = hash(query)
if key in cache:
return cache[key]
docs = vector_db.search(query)
answer = generator.generate(docs, query)
cache[key] = answer
return answer