Видео трансформатору эмне (ViViT, TimeSformer)?
sobes.tech AI
AIден жооп
Video Transformer — бул трансформаторлорго негизделген архитектура, ал видеодон алынган маалыматтарды иштетүүгө ылайыкталган. Классикалык CNNдерден айырмаланып, Video Transformers өзүн-өзү көңүл буруу (self-attention) механизмин колдонуп, видеодогу кеңістик-убакыттык көзкараштарды моделдөө үчүн пайдаланышат.
ViViT (Video Vision Transformer) жана TimeSformer — бул моделдердин эки белгилүү варианты:
-
ViViT видеону кеңістик-убакыттык парчаларга (patch) бөлөт жана аларды трансформаторго киргизет. ViViT кеңістик жана убакыт боюнча маалыматтарды топтоо үчүн ар кандай стратегияларды колдонуп, бөлүнгөн жана биргелешкен көңүл буруу механизмдерин камтыйт.
-
TimeSformer бөлүнгөн көңүл бурууну колдонуп, биринчи кезекте ар бир кадрдын кеңістик өлчөмдөрүнө көңүл бурат, андан кийин кадрлар арасындагы убакыттык өлчөмдөргө. Бул толук кеңістик-убакыттык көңүл бурууга салыштырмалуу эсептөө жөндөмдүүлүгүн төмөндөтөт.
Эки модел да видеодогу татаал көзкараштарды эффективдүү кармап, классификация, аракеттерди таануу жана башка компьютер көрүү тапшырмаларын жакшыртат.
TimeSformerдин жөнөкөйлөштүрүлгөн идеясынын мисалы:
# бөлүнгөн көңүл буруу үчүн псевдокод
видеодогу ар бир кадр үчүн:
кеңістик өзгөчөлүктөр = кеңістик_көңүл буруу(кадр парчалары)
time_features = убакыттык_көңүл буруу(кеңістик_өзгөчөлүктөр, кадрлар арасында)
чыгуу = классификатор(убакыттык_өзгөчөлүктөр)
Ошентип, Video Transformers — видеону талдоо үчүн күчтүү инструмент, ал трансформаторлордун артыкчылыктарын пайдаланып, татаал кеңістик-убакыттык үлгүлөрдү моделдөөдө жардам берет.