¿Qué técnicas de entrenamiento offline de LTR a partir de registros de clics (evaluación contrafactual)?
sobes.tech AI
Respuesta de la IA
El aprendizaje fuera de línea Learning to Rank (LTR) a partir de registros de clics utilizando evaluación contrafactual es un enfoque para entrenar modelos de clasificación, donde los datos de clics se recopilan en condiciones reales, pero se utiliza una metodología que tiene en cuenta el sesgo en los datos.
Técnicas principales:
-
Puntuación de Propensión Inversa (IPS) — ajuste de la influencia de los clics considerando la probabilidad de que un documento sea mostrado al usuario. Esto ayuda a compensar el sesgo posicional (las posiciones en los resultados afectan la probabilidad de clic).
-
Estimadores Doble Robustos — combinan IPS con un modelo de predicción de clics, reduciendo la varianza de la estimación y aumentando la estabilidad.
-
Aprendizaje Contrafactual — entrenar el modelo basado en registros recopilados bajo una política de clasificación diferente, utilizando métodos de evaluación que consideran la diferencia entre la política actual y la antigua.
-
Evaluación Off-policy — evaluación de la calidad de un nuevo modelo sin desplegarlo, usando datos recopilados por un modelo antiguo.
Ejemplo: si tienes registros de clics en posiciones 1-10, para entrenar el modelo ponderas cada clic por la probabilidad inversa de que el documento fuera mostrado en esa posición, para compensar que los usuarios clickean más en las posiciones superiores.
De esta manera, el aprendizaje fuera de línea LTR con evaluación contrafactual permite utilizar eficazmente datos reales de usuarios, minimizando sesgos y mejorando la calidad de la clasificación sin necesidad de pruebas A/B constantes.