Sobes.tech
Senior

Какви защити се прилагат (филтри за вход/изход, засилване на системния промпт, предпазни огради)?

sobes.tech AI

Отговор от AI

Защитите в системи с ИИ и машинно обучение включват няколко нива:

  • Филтри за вход — проверяват и почистват входните данни, за да предотвратят въвеждането на вредни или неправилни заявки. Например филтриране на токсично съдържание, SQL инжекции или опити за заобикаляне на модела.

  • Филтри за изход — анализират и коригират отговорите на модела, за да изключат нежелано, опасно или конфиденциално съдържание. Това помага да се избегнат течове на данни и генериране на вредни инструкции.

  • Укрепване на системните подсказки — засилва системните подсказки (system prompts), за да ограничи поведението на модела, например, чрез ясно определяне на роли, правила и ограничения, така че моделът да не излиза извън допустимите граници.

  • Guardrails — набор от правила и ограничения, реализирани на ниво логика на приложението или модела, които предотвратяват нежелани действия, като генериране на забранено съдържание, заобикаляне на филтрите или изпълнение на опасни команди.

Пример: при създаване на чатбот с ИИ може да се реализира филтър за входящи съобщения, който блокира заявки за получаване на лични данни, както и филтър за изходящи съобщения, който премахва или заменя потенциално опасни инструкции. System prompt може да съдържа инструкции да не разкрива вътрешните механизми или да не изпълнява команди, свързани с вредни действия.