Middle — Senior
Como preparar um conjunto de dados de preferências para DPO?
sobes.tech IA
Resposta da IA
Para preparar um conjunto de dados de preferências (preference dataset) para DPO (Otimização de Preferências Diretas), é importante recolher pares de dados onde uma das alternativas seja claramente preferida em relação à outra.
Principais passos:
- Recolha de dados de preferências: Por exemplo, um utilizador escolhe uma resposta entre várias, ou um especialista avalia as opções.
- Formatação: Cada registo deve conter um par de opções (A e B) e uma etiqueta que indique que A é preferido sobre B.
- Balanceamento: É recomendável que os dados sejam diversos e equilibrados em temas e estilos.
- Limpeza: Remoção de pares ambíguos ou contraditórios.
- Tokenização e preparação para o modelo: Transformar os textos num formato adequado para o treino.
Exemplo de registo:
{
"prompt": "Pergunta ou contexto",
"chosen": "Resposta preferida",
"rejected": "Resposta menos preferida"
}
Este conjunto de dados permite ao modelo aprender a escolher as melhores respostas com base em preferências.