CLIP: nápad, ztrátová funkce, tréninková metoda, k čemu se používá. Jaké metriky vzdálenosti mezi embeddingy lze použít a které použili autoři?
sobes.tech AI
Odpověď od AI
CLIP (Contrastive Language–Image Pre-training) je model vyvinutý společností OpenAI pro společné učení reprezentací obrázků a textu. Myšlenkou je naučit model spojovat obrázky a jejich textové popisy v společném prostoru vnoření.
Funkce ztráty: používá se kontrastivní ztráta (například InfoNCE), která maximalizuje podobnost mezi vnořeními párů "obrázek-text", které odpovídají sobě, a minimalizuje podobnost s nepřiřazenými páry.
Způsob učení: model je trénován na velkém množství párů (obrázek, popis) pomocí dvou enkodérů — pro obrázky a pro text. Učení probíhá minimalizací kontrastivní funkce ztráty, která podporuje blízkost vnoření spojených párů a oddělení nevázaných.
Použití: CLIP se používá pro úlohy multimodálního vyhledávání, klasifikaci obrázků bez dalšího učení (zero-shot), generování popisů a dalších úloh, kde je třeba spojit vizuální a textové informace.
Metriky vzdálenosti: pro měření podobnosti mezi vnořeními se obvykle používá kosinusová podobnost, euklidovská nebo Manhattanova vzdálenost. Autoři CLIP použili specificky kosinusovou podobnost, protože je vhodná pro porovnávání směrů vektorového prostoru a normalizuje délku vektorů.