Word2Vec o'qitishdagi negative sampling nima va nima uchun kerak?
sobes.tech AI
AIdan javob
Negativ namunalar — bu optimallashtirish texnikasi bo‘lib, word2vec modelini o‘qitishda juda katta lug‘at bilan ishlashda samarali o‘qitishni ta’minlaydi. Lug‘atdagi barcha so‘zlar uchun ehtimollikni hisoblash o‘rniga (bu juda qimmatga tushadi), negativ namunalar tanlanadi (so‘zlar, bu so‘zning kontekstiga kiradigan so‘zlar emas) va modelga haqiqiy so‘z juftliklarini (ijobiy misollar) tasodifiylardan (negativlar) ajratishni o‘rgatadi.
Bu o‘qitishni sezilarli darajada tezlashtiradi va hisoblash xarajatlarini kamaytiradi, shu bilan birga olingan embeddinglarning sifatini saqlab qoladi. Natijada, model yaqin so‘zlarning ehtimolini oshirishni va tasodifiy so‘zlarning ehtimolini kamaytirishni o‘rganadi.
Misol: (so‘z, kontekst) jufti uchun — ijobiy misol — lug‘atdan bir nechta tasodifiy so‘zlar negativ sifatida tanlanadi va model ularni ajratishni o‘rganadi.
# Negativ namunalar uchun pseudokod
for target_word, context_word in corpus:
positive_pair = (target_word, context_word)
negative_samples = sample_negative_words(k) # k — negativ misollar soni
update_model(positive_pair, negative_samples)