Sobes.tech
Middle — Senior

Milyen képen belüli szövegdetekciós modellek (DBNet, EAST, CRAFT)?

sobes.tech MI

Válasz az MI-től

A DBNet, EAST és CRAFT modern modellek az képekben lévő szöveg detektálására, amelyeket OCR (optikai karakterfelismerés) feladatokban használnak. Különböznek architektúrában és megközelítésben a szövegterületek kiemelésében.

  • EAST (Hatékony és pontos jelenet szöveg detektor)

    • Konvolúciós neurális hálózatot használ, hogy téglalap alakú vagy irányított kereteket jósoljon a szövegterületek körül.
    • Gyors és pontos, jól alkalmas a természetes jelenetekben lévő szöveg detektálására.
  • CRAFT (Karakter régió tudatosság a szöveg detektálásához)

    • Egyedi karakterek és kapcsolataik detektálására összpontosít.
    • Kiemeli a magas valószínűségű területeket, és összekapcsolja őket szavakká vagy sorokká.
    • Különösen hatékony összetett és heterogén szövegstruktúrák esetén.
  • DBNet (Differenciálható binarizációs hálózat)

    • Differenciálható binarizációt használ a szövegterületek szegmentálásának minőségének javítására.
    • Pontosabb szöveg régiók detektálását teszi lehetővé, különösen összetett háttéren.

Ezek a modellek általában az OCR rendszerek első lépéseként használatosak — a szöveg lokalizálására, majd a karakterfelismerésre.

CRAFT használati példája:

  • Egy kép bemenetként kerül be.
  • A modell valószínűségi térképeket generál a karakterekről és kapcsolataikról.
  • Ezek alapján határoló dobozokat alkotnak szavak vagy sorok számára.

A modell kiválasztása a feladattól függ: az EAST gyors detektálásra jó, a CRAFT összetett szövegstruktúrákra, a DBNet pedig pontos szegmentálásra.