Middle — Senior
Hogyan kezeljük a táblázatokat és képeket a RAG dokumentumaiban?
sobes.tech MI
Válasz az MI-től
A Retrieval-Augmented Generation (RAG) feladatokban a dokumentumokban található táblák és képek feldolgozása speciális megközelítéseket igényel, mivel az LLM-ek általában szöveggel dolgoznak.
Táblák esetén:
- A táblákat szövegformátumba lehet konvertálni, például CSV vagy Markdown formátumba, megőrizve a sorok és oszlopok szerkezetét.
- Speciális elemzőket lehet használni a kulcsfontosságú adatok kinyerésére és azok a modell számára megfelelő formátumban való bemutatására.
- Szükség esetén a fejlécsorokat és kulcsfontosságú cellákat kiemelhetjük a kontextus jobb megértése érdekében.
Képek esetén:
- Szöveg kinyerése képekből OCR (optikai karakterfelismerés) segítségével, hogy szöveges információt kapjunk.
- Komplex képek (grafikonok, diagramok) esetén speciális modelleket lehet használni az elemzéshez és a strukturált adatokra való átalakításhoz.
- Bizonyos esetekben a képeket vektoralapú reprezentációkba (embeddings) kódolják, és a szöveges embeddingekkel együtt használják kereséshez és generáláshoz.
Így, mielőtt adatokat adunk be a RAG rendszerbe, a táblákat és képeket szöveges vagy vektoralapú reprezentációkká alakítjuk, amelyeket hatékonyan lehet indexelni és felhasználni a válaszok generálásához.