Sobes.tech
Middle — Senior

Quais modelos de deteção de texto em imagens (DBNet, EAST, CRAFT)?

sobes.tech IA

Resposta da IA

DBNet, EAST e CRAFT são modelos modernos para deteção de texto em imagens, utilizados em tarefas de OCR (reconhecimento óptico de caracteres). Diferenciam-se na arquitetura e abordagens para identificar áreas de texto.

  • EAST (Detetor de texto eficiente e preciso em cenas)

    • Utiliza uma rede neural convolucional para prever quadros retangulares ou orientados ao redor de áreas de texto.
    • Rápido e preciso, adequado para detectar texto em cenas naturais.
  • CRAFT (Consciência de regiões de caracteres para deteção de texto)

    • Foca na deteção de caracteres individuais e suas ligações.
    • Destaca áreas com alta probabilidade de conter caracteres e as liga em palavras ou linhas.
    • Especialmente eficaz para estruturas de texto complexas e heterogéneas.
  • DBNet (Rede de binarização diferenciável)

    • Utiliza binarização diferenciável para melhorar a qualidade da segmentação de áreas de texto.
    • Permite uma deteção mais precisa de regiões de texto, especialmente em fundos complexos.

Estes modelos são geralmente utilizados como primeira etapa em sistemas OCR — para localizar o texto, seguido do reconhecimento de caracteres.

Exemplo de uso do CRAFT:

  • Uma imagem é fornecida como entrada.
  • O modelo gera mapas de probabilidade de caracteres e suas ligações.
  • Com base nesses mapas, são formadas caixas delimitadoras para palavras ou linhas.

A escolha do modelo depende da tarefa: EAST é bom para deteção rápida, CRAFT para estruturas de texto complexas, e DBNet para segmentação precisa.