Sobes.tech
Senior

Mis on clean-label backdoor?

sobes.tech AI

Vastus AI-lt

Clean-label backdoor — see on varjatud haavatavuse tüüp masinõppemudelites, kus kahjulik käitumine sisestatakse mudelisse treeningandmete kaudu, muutmata nähtavaid silte ega andmestruktuuri.

Erinevalt traditsioonilistest backdoor-rünnakutest, kus andmed võivad olla selgelt märgistatud või muudetud (näiteks lisades triggereid erksa sildiga), kasutab clean-label backdoor "puhtaid" andmeid õige siltidega, mis raskendab nende avastamist.

Näide: ründaja lisab treeningkomplekti pilte kindla mustriga (trigger), kuid nende piltide sildid vastavad nende sisule. Mudel treenitakse nende andmete põhjal ja töötab tavatingimustes õigesti, kuid triggere ilmumisel sisendandmetes käitub mudel tahtlikult valesti.

See kujutab endast tõsist turvaohtu, kuna selliseid backdoor-e on keeruline avastada standardmeetoditega, mis kontrollivad mudeli kvaliteeti ja terviklikkust.