CLIP: идея, функция потерь, тәсіл оқыту, не үшін пайдаланылады. Эмбеддингтер арасындағы қашықтық метрикалары қандай болуы мүмкін және авторлар қандай қолданды?
sobes.tech AI
AI-дан жауап
CLIP (Contrastive Language–Image Pre-training) — бұл OpenAI әзірлеген суреттер мен мәтіндердің ұсынуларын бірлесіп оқыту моделін. Идея — модельге суреттер мен олардың мәтін сипаттамаларын жалпы эмбеддинг кеңістігінде сәйкестендіруді үйрету.
Зақымдалу функциясы: контрастивті жоғалту (мысалы, InfoNCE) пайдаланылады, ол «сурет-мәтін» жұптарының эмбеддингтері арасындағы ұқсастықты максимизациялайды және сәйкес емес жұптармен ұқсастықты минимизациялайды.
Оқыту әдісі: модель үлкен жұптар жиынтығында (сурет, сипаттама) екі энкодер арқылы оқытылады — суреттер мен мәтіндер үшін. Оқу контрастивті жоғалту функциясын минимизациялау арқылы жүзеге асырылады, ол байланысты жұптардың эмбеддингтерінің жақындығын және байланысты емес эмбеддингтердің алшақтығын ынталандырады.
Қолданылуы: CLIP мультимодальды іздеу, суреттерді классификациялау (zero-shot), сипаттамалар генерациясы және басқа да тапсырмалар үшін пайдаланылады, мұнда визуалды және мәтіндік ақпаратты байланыстыру қажет.
Қашықтық метрикалары: эмбеддингтер арасындағы ұқсастықты өлшеу үшін әдетте косинус ұқсастығы, евклидтік немесе Манхэттен қашықтығы пайдаланылады. CLIP авторлары дәл косинус ұқсастығын қолданды, себебі ол вектор кеңістігінде бағыттарды салыстыруға жақсы сәйкес келеді және векторлардың ұзындығын нормализациялайды.