Ի՞նչ է negative sampling-ը word2vec-ի ուսուցման ժամանակ և ինչու է դա անհրաժեշտ:
sobes.tech AI
Պատասխան AI-ից
Մերժական նմուշառումը տեխնիկա է, որը օգտագործվում է word2vec մոդելի ուսուցման ժամանակ՝ արդյունավետ ուսուցում ապահովելու համար շատ մեծ բառարանով աշխատելիս։ Փոխարենը, որ հաշվարկի հավանականությունը բոլոր բառերի համար բառարանում (որն շատ թանկ է), մերժական նմուշառումը ընտրում է մի քանի «նեգատիվ» օրինակներ (բառեր, որոնք չեն հանդիսանում տվյալ բառի կոնտեքստի մաս) և ուսուցանում է մոդելին տարբերել իրական բառերի զույգերը (հաստատական օրինակներ) պատահականներից (նեգատիվներ)։
Այսպիսով, հնարավոր է զգալիորեն արագացնել ուսուցումը և նվազեցնել հաշվարկային ծախսերը՝ միաժամանակ պահպանելով ստացված ներդրումների որակը։ Վերջում, մոդելը սովորում է մեծացնել հարևան բառերի հավանականությունը և նվազեցնել պատահական բառերի հավանականությունը։
Օրինակ՝ (բառ, կոնտեքստ) զույգի համար — հաստատական օրինակ — ընտրվում են մի քանի պատահական բառեր բառարանից որպես նեգատիվ, և մոդելը սովորում է տարբերել դրանք։
# Նեգատիվ նմուշառման псևդոկոդ
for target_word, context_word in corpus:
positive_pair = (target_word, context_word)
negative_samples = sample_negative_words(k) # k — նեգատիվ օրինակների քանակը
update_model(positive_pair, negative_samples)