Sobes.tech
Senior

Kokios apsaugos yra taikomos (įvesties/išvesties filtrai, sistemos prompt stiprinimas, apsaugos barjerai)?

sobes.tech AI

Atsakymas iš AI

Dirbtinio intelekto ir mašininio mokymosi sistemų apsauga apima keletą lygių:

  • Įvesties filtrai — tikrina ir valo įvesties duomenis, siekiant užkirsti kelią žalingų ar klaidingų užklausų įvedimui. Pavyzdžiui, filtruojant toksišką turinį, SQL injekcijas ar bandymus apeiti modelį.

  • Išvesties filtrai — analizuoja ir koreguoja modelio atsakymus, kad išvengtų nepageidaujamo, pavojingo ar konfidencialaus turinio. Tai padeda išvengti duomenų nutekėjimo ir žalingų instrukcijų generavimo.

  • Sisteminio prompto stiprinimas — sustiprina sisteminius nurodymus (system prompts), kad apribotų modelio elgesį, pavyzdžiui, aiškiai apibrėžiant vaidmenis, taisykles ir apribojimus, kad modelis neperžengtų leidžiamų ribų.

  • Guardrails — taisyklių ir apribojimų rinkinys, įgyvendintas programėlės ar modelio logikos lygyje, kuris užkerta kelią nepageidaujamoms veikloms, tokioms kaip draudžiamo turinio generavimas, filtrų apeidinėjimas ar pavojingų komandų vykdymas.

Pavyzdys: kuriant AI pokalbių robotą, galima įgyvendinti įvesties žinučių filtrą, kuris blokuoja užklausas gauti asmeninę informaciją, taip pat išvesties žinučių filtrą, kuris pašalina arba keičia potencialiai pavojingas instrukcijas. Sistemos promptas gali turėti nurodymus, kad neatskleistų vidinių mechanizmų ar nevykdytų žalingų veiksmų susijusių komandų.