Sobes.tech
Middle — Senior

Hogyan kezeljük a táblázatokat és képeket a RAG dokumentumaiban?

sobes.tech MI

Válasz az MI-től

A Retrieval-Augmented Generation (RAG) feladatokban a dokumentumokban található táblák és képek feldolgozása speciális megközelítéseket igényel, mivel az LLM-ek általában szöveggel dolgoznak.

Táblák esetén:

  • A táblákat szövegformátumba lehet konvertálni, például CSV vagy Markdown formátumba, megőrizve a sorok és oszlopok szerkezetét.
  • Speciális elemzőket lehet használni a kulcsfontosságú adatok kinyerésére és azok a modell számára megfelelő formátumban való bemutatására.
  • Szükség esetén a fejlécsorokat és kulcsfontosságú cellákat kiemelhetjük a kontextus jobb megértése érdekében.

Képek esetén:

  • Szöveg kinyerése képekből OCR (optikai karakterfelismerés) segítségével, hogy szöveges információt kapjunk.
  • Komplex képek (grafikonok, diagramok) esetén speciális modelleket lehet használni az elemzéshez és a strukturált adatokra való átalakításhoz.
  • Bizonyos esetekben a képeket vektoralapú reprezentációkba (embeddings) kódolják, és a szöveges embeddingekkel együtt használják kereséshez és generáláshoz.

Így, mielőtt adatokat adunk be a RAG rendszerbe, a táblákat és képeket szöveges vagy vektoralapú reprezentációkká alakítjuk, amelyeket hatékonyan lehet indexelni és felhasználni a válaszok generálásához.