Kādas aizsardzības tiek piemērotas (ievades/izvades filtri, sistēmas prompt stiprināšana, aizsargbarjeras)?
sobes.tech AI
Atbilde no AI
Aizsardzība sistēmās ar mākslīgo intelektu un mašīnmācīšanos ietver vairākus līmeņus:
-
Ievades filtri — pārbauda un attīra ievades datus, lai novērstu kaitīgu vai nepareizu pieprasījumu ievadi. Piemēram, filtrē toksisku saturu, SQL injekcijas vai mēģinājumus apiet modeli.
-
Izvades filtri — analizē un koriģē modeļa atbildes, lai izslēgtu nevēlamu, bīstamu vai konfidenciālu saturu. Tas palīdz novērst datu noplūdi un kaitīgu instrukciju ģenerēšanu.
-
Sistēmas prompta stiprināšana — stiprina sistēmas norādījumus (system prompts), lai ierobežotu modeļa uzvedību, piemēram, skaidri definējot lomas, noteikumus un ierobežojumus, lai modelis nepārsniegtu atļautās robežas.
-
Guardrails — noteikumu un ierobežojumu kopums, kas īstenots lietojumprogrammas vai modeļa līmenī, lai novērstu nevēlamas darbības, piemēram, aizliegtā satura ģenerēšanu, filtru apiet vai bīstamu komandu izpildi.
Piemērs: izveidojot AI čatbotu, var ieviest ievades ziņojumu filtru, kas bloķē pieprasījumus iegūt personisko informāciju, kā arī izvades ziņojumu filtru, kas noņem vai aizstāj potenciāli bīstamas instrukcijas. Sistēmas promptā var būt norādījumi, lai neatklātu iekšējos mehānismus vai neizpildītu kaitīgas darbības saistītās komandas.