Sobes.tech
Middle — Senior

Kuidas vahemällu salvestada kõige sagedamini esitatavad päringud RAG-is?

sobes.tech AI

Vastus AI-lt

Retrieval-Augmented Generation (RAG) süsteemis aitab sageli esitatavate küsimuste vahemälu vähendada viivitusi ja koormust vektordatabaasis ning generatiivses mudelis. Peamised lähenemisviisid:

  • Otsingutulemuste vahemälu: salvestage otsingutulemused vektordatabaasis sageli korduvate küsimuste jaoks. Kui küsimus kordub, tagastage salvestatud dokumendid ilma uue otsinguta.

  • Genereeritud vastuste vahemälu: kui küsimus ja kontekst kattuvad, saab tagastada varem genereeritud vastuse.

  • TTL (time-to-live) kasutamine: et vahemälu ei vananeks, määrake salvestatud andmete eluea aeg.

  • Küsimuste hashimine: kiireks otsinguks vahemälus, kasutades küsimuse hash-ile põhinevat võtit.

Näide Pythonis lihtsa sõnastiku kasutamisega vahemälu jaoks:

cache = {}

def get_rag_response(query):
    key = hash(query)
    if key in cache:
        return cache[key]
    docs = vector_db.search(query)
    answer = generator.generate(docs, query)
    cache[key] = answer
    return answer