Sobes.tech
Middle — Senior

Kokie yra vaizdų teksto aptikimo modeliai (DBNet, EAST, CRAFT)?

sobes.tech AI

Atsakymas iš AI

DBNet, EAST ir CRAFT yra šiuolaikiniai modeliai, skirti teksto aptikimui vaizduose, naudojami OCR (optinis simbolių atpažinimas) užduotyse. Jie skiriasi architektūra ir požiūriais į teksto sričių išskyrimą.

  • EAST (Efektyvus ir tikslus scenos teksto detektorius)

    • Naudoja konvoliucinį neuroninį tinklą, kad prognozuotų stačiakampius arba orientuotus rėmelius aplink teksto sritis.
    • Greitas ir tikslus, tinkamas natūralių scenų teksto aptikimui.
  • CRAFT (Simbolių regionų sąmoningumas teksto aptikimui)

    • Susitelkia į atskirų simbolių ir jų ryšių aptikimą.
    • Pabrėžia sritis su didelėmis tikimybėmis turėti simbolius ir jas sujungia į žodžius ar eilutes.
    • Ypač efektyvus sudėtingoms ir heterogeninėms teksto struktūroms.
  • DBNet (Diferencijuojama binarizacijos tinklas)

    • Naudoja diferencijuojamą binarizaciją, siekiant pagerinti teksto sričių segmentacijos kokybę.
    • Leidžia tiksliau aptikti teksto regionus, ypač sudėtinguose fonuose.

Šie modeliai dažniausiai naudojami kaip pirmas žingsnis OCR sistemose — teksto lokalizacijai, po to seka simbolių atpažinimas.

CRAFT naudojimo pavyzdys:

  • Pateikiama įvesties nuotrauka.
  • Modelis generuoja tikimybės žemėlapius simboliams ir jų ryšiams.
  • Remiantis šiais žemėlapiais formuojami apibrėžimo rėmeliai žodžiams ar eilutėms.

Modelio pasirinkimas priklauso nuo užduoties: EAST yra geras greitam aptikimui, CRAFT — sudėtingoms teksto struktūroms, o DBNet — tiksliam segmentavimui.