Sobes.tech
Middle — Senior

Kaip apdoroti lenteles ir vaizdus dokumentuose RAG?

sobes.tech AI

Atsakymas iš AI

Retrieval-Augmented Generation (RAG) užduotyse dokumentuose esantys lentelės ir vaizdai reikalauja specialių požiūrių, nes LLM dažniausiai dirba su tekstu.

Lentelėms:

  • Lentelės gali būti konvertuotos į tekstinį formatą, pvz., CSV arba Markdown, išlaikant eilučių ir stulpelių struktūrą.
  • Gali būti naudojami specializuoti analizatoriai, norint išgauti pagrindinius duomenis ir juos pateikti patogiu modelio formatu.
  • Jei reikia, antraštės ir pagrindinės langeliai gali būti išryškinti, siekiant geriau suprasti kontekstą.

Vaizdams:

  • Tekstas iš vaizdų gali būti išgautas naudojant OCR (optinis simbolių atpažinimas), siekiant gauti tekstinę informaciją.
  • Sudėtingiems vaizdams (grafikams, diagramoms) gali būti naudojami specializuoti modeliai analizei ir struktūrizuotų duomenų konvertavimui.
  • Kai kuriais atvejais vaizdai koduojami į vektorinę reprezentaciją (embeddings) ir naudojami kartu su tekstinėmis embeddings, ieškant ir generuojant.

Taip, prieš įvedant duomenis į RAG sistemą, lentelių ir vaizdų duomenys yra konvertuojami į tekstines arba vektorinės reprezentacijas, kurios gali būti efektyviai indeksuojamos ir naudojamos atsakymų generavimui.