Kuidas vahemällu salvestada kõige sagedamini esitatavad päringud RAG-is?
sobes.tech AI
Vastus AI-lt
Retrieval-Augmented Generation (RAG) süsteemis aitab sageli esitatavate küsimuste vahemälu vähendada viivitusi ja koormust vektordatabaasis ning generatiivses mudelis. Peamised lähenemisviisid:
-
Otsingutulemuste vahemälu: salvestage otsingutulemused vektordatabaasis sageli korduvate küsimuste jaoks. Kui küsimus kordub, tagastage salvestatud dokumendid ilma uue otsinguta.
-
Genereeritud vastuste vahemälu: kui küsimus ja kontekst kattuvad, saab tagastada varem genereeritud vastuse.
-
TTL (time-to-live) kasutamine: et vahemälu ei vananeks, määrake salvestatud andmete eluea aeg.
-
Küsimuste hashimine: kiireks otsinguks vahemälus, kasutades küsimuse hash-ile põhinevat võtit.
Näide Pythonis lihtsa sõnastiku kasutamisega vahemälu jaoks:
cache = {}
def get_rag_response(query):
key = hash(query)
if key in cache:
return cache[key]
docs = vector_db.search(query)
answer = generator.generate(docs, query)
cache[key] = answer
return answer