O que é o Mask2Former e qual é a sua abordagem baseada em consultas?
sobes.tech IA
Resposta da IA
Mask2Former é uma abordagem moderna para tarefas de segmentação de imagens que combina diferentes tipos de segmentação (por exemplo, semântica, de instância e panóptica) numa arquitetura unificada. A ideia principal é usar um mecanismo baseado em consultas (query-based), inspirado nos transformadores, para prever máscaras de objetos.
Em vez de um classificador clássico linha por linha ou pixel por pixel, o Mask2Former formula a segmentação como uma tarefa de busca de um conjunto de máscaras usando um conjunto de consultas aprendíveis. Cada consulta é responsável por prever uma máscara e a sua classe. Isto permite que o modelo separe objetos e fundo de forma eficiente, bem como lidar com diferentes tipos de segmentação num mesmo quadro.
Funciona aproximadamente assim:
- A imagem de entrada passa por um backbone (por exemplo, CNN ou transformador) para extrair características.
- Essas características são introduzidas num transformador, onde as consultas aprendíveis interagem com as características.
- A saída para cada consulta é uma máscara e uma classe.
Esta abordagem simplifica a arquitetura e melhora a qualidade da segmentação graças ao contexto global e à flexibilidade das consultas.