Middle — Senior
Kā kešēt biežāk uzdotos pieprasījumus RAG?
sobes.tech AI
Atbilde no AI
Retrieval-Augmented Generation (RAG) sistēmā bieži uzdoto jautājumu kešošana palīdz samazināt aizkavi un slodzi uz vektoru datu bāzi un ģeneratīvo modeli. Galvenie pieejas veidi:
-
Meklēšanas rezultātu kešošana: saglabājiet meklēšanas rezultātus vektoru datu bāzē bieži atkārtotu jautājumu gadījumā. Atkārtotā jautājumā atgrieziet saglabātos dokumentus bez jaunas meklēšanas.
-
Ģenerēto atbilžu kešošana: ja jautājums un konteksts sakrīt, varat atgriezt iepriekš ģenerētu atbildi.
-
TTL (time-to-live) izmantošana: lai kešs neapniktu, iestatiet dzīves laiku saglabātajiem datiem.
-
Jautājumu hashēšana: ātrai meklēšanai kešā, balstoties uz jautājuma hash.
Piemērs Python ar vienkāršu vārdnīcu kā kešu:
cache = {}
def get_rag_response(query):
key = hash(query)
if key in cache:
return cache[key]
docs = vector_db.search(query)
answer = generator.generate(docs, query)
cache[key] = answer
return answer