Middle — Senior
Kaip apdoroti lenteles ir vaizdus dokumentuose RAG?
sobes.tech AI
Atsakymas iš AI
Retrieval-Augmented Generation (RAG) užduotyse dokumentuose esantys lentelės ir vaizdai reikalauja specialių požiūrių, nes LLM dažniausiai dirba su tekstu.
Lentelėms:
- Lentelės gali būti konvertuotos į tekstinį formatą, pvz., CSV arba Markdown, išlaikant eilučių ir stulpelių struktūrą.
- Gali būti naudojami specializuoti analizatoriai, norint išgauti pagrindinius duomenis ir juos pateikti patogiu modelio formatu.
- Jei reikia, antraštės ir pagrindinės langeliai gali būti išryškinti, siekiant geriau suprasti kontekstą.
Vaizdams:
- Tekstas iš vaizdų gali būti išgautas naudojant OCR (optinis simbolių atpažinimas), siekiant gauti tekstinę informaciją.
- Sudėtingiems vaizdams (grafikams, diagramoms) gali būti naudojami specializuoti modeliai analizei ir struktūrizuotų duomenų konvertavimui.
- Kai kuriais atvejais vaizdai koduojami į vektorinę reprezentaciją (embeddings) ir naudojami kartu su tekstinėmis embeddings, ieškant ir generuojant.
Taip, prieš įvedant duomenis į RAG sistemą, lentelių ir vaizdų duomenys yra konvertuojami į tekstines arba vektorinės reprezentacijas, kurios gali būti efektyviai indeksuojamos ir naudojamos atsakymų generavimui.