Sobes.tech
Senior

O que é a parametrização de previsão v vs eps?

sobes.tech IA

Resposta da IA

v-prediction e eps-prediction são duas formas diferentes de parametrizar o processo de difusão em modelos generativos, como os modelos de difusão para geração de imagens.

  • v-prediction (previsão de velocidade) — o modelo é treinado para prever a "velocidade" de mudança do ruído, ou seja, uma combinação da imagem original e do ruído. Isso permite melhorar a estabilidade e a qualidade da geração, pois o modelo foca na previsão da direção da mudança.

  • eps-prediction (previsão de epsilon) — o modelo prevê diretamente o ruído adicionado em cada passo da difusão. Essa é uma abordagem clássica, onde a tarefa do modelo é restaurar o ruído para obter uma imagem limpa posteriormente.

A principal diferença é que v-prediction pode considerar melhor a dinâmica do processo de difusão, o que às vezes resulta em resultados de maior qualidade e treinamento mais estável. A escolha da parametrização depende da arquitetura e da tarefa, mas ambas são amplamente utilizadas em modelos de difusão modernos.