CLIP: pomysł, funkcja straty, sposób uczenia, do czego służy. Jakie metryki odległości między osadzeniami można używać i które zastosowali autorzy?
sobes.tech AI
Odpowiedź od AI
CLIP (Contrastive Language–Image Pre-training) to model opracowany przez OpenAI do wspólnego uczenia reprezentacji obrazów i tekstu. Pomysł polega na nauczeniu modelu kojarzenia obrazów i ich opisów tekstowych w wspólnej przestrzeni osadzeń.
Funkcja straty: używa się kontrastowej straty (np. InfoNCE), która maksymalizuje podobieństwo między osadzeniami par "obraz-tekst" odpowiadających sobie, i minimalizuje podobieństwo z niepasującymi parami.
Metoda uczenia: model jest trenowany na dużym zbiorze par (obraz, podpis) za pomocą dwóch enkoderów — dla obrazów i dla tekstu. Uczenie polega na minimalizacji kontrastowej funkcji straty, która promuje bliskość osadzeń powiązanych par i oddzielenie osadzeń niepowiązanych.
Zastosowanie: CLIP stosuje się do zadań wyszukiwania multimodalnego, klasyfikacji obrazów bez dodatkowego uczenia (zero-shot), generowania opisów i innych zadań, gdzie konieczne jest powiązanie informacji wizualnych i tekstowych.
Metryki odległości: do pomiaru podobieństwa między osadzeniami zwykle używa się podobieństwa cosinusowego, odległości euklidesowej lub Manhattan. Autorzy CLIP używali szczególnie podobieństwa cosinusowego, ponieważ dobrze nadaje się do porównywania kierunków w przestrzeni wektorowej i normalizuje długość wektorów.