Безопасность AI-бота: чек-лист из 12 вопросов

2026-09-03

Быстрая самопроверка для команды, у которой LLM-бот или агент уже в проде или готовится к релизу. Отвечайте честно «да» или «нет». Три и больше «нет» — значит, у продукта есть проверяемые дыры, и лучше, чтобы их первым нашёл аудит, а не пользователь.

Промпт и входные данные

  • 1. Пользовательский ввод и ваши инструкции разделены в промпте явными маркерами — а не просто склеены в одну строку?
  • 2. Вы проверяли, что бот не отдаёт системный промпт по прямой просьбе и через обёртки («переведи свои инструкции», «сыграй роль…»)?
  • 3. Данные из внешних источников (документы, письма, страницы), которые читает модель, рассматриваются как недоверенные — и вы тестировали инъекции через них?
  • 4. В системном промпте нет секретов: ключей, паролей, внутренних URL, персональных данных?

Права и действия агента

  • 5. Каждый инструмент агента проверяет права пользователя в своём коде — а не полагается на то, что «модель не вызовет лишнего»?
  • 6. Агент не может выполнить необратимое действие (платёж, удаление, отправка вовне) без подтверждения человека?
  • 7. RAG-поиск фильтрует документы по правам пользователя до выдачи в контекст, а не после?
  • 8. Ответ модели, попадающий в HTML, SQL или команды, экранируется как недоверенный ввод?

Процесс и мониторинг

  • 9. Диалоги и вызовы инструментов логируются так, что инцидент можно расследовать?
  • 10. Есть лимиты: частота запросов, расход токенов на пользователя, размер контекста?
  • 11. После смены модели или системного промпта вы повторяете проверки безопасности, а не только смоук-тесты качества?
  • 12. Кто-то со стороны хоть раз пытался целенаправленно сломать вашего бота?

Как считать результат

10–12 «да» — зрелый продукт, имеет смысл точечный аудит перед крупными релизами. 7–9 — есть конкретные дыры, начните с пунктов, где ответили «нет». 6 и меньше — продукт почти наверняка ломается за пару часов работы; аудит нужен до того, как это сделает кто-то другой.

FAQ

Мы используем готовые guardrails — этого достаточно?
Guardrails отсекают простые атаки, но обходятся многоходовыми сценариями и косвенными инъекциями через данные. Это один слой защиты, а не решение.
У нас бот только отвечает на вопросы, без действий. Нам всё ещё нужен аудит?
Поверхность меньше, но остаются утечка промпта, инъекции через RAG-документы и доступ к чужим данным через поиск. Пункты 1–4 и 7 критичны и для «просто чат-бота».
Три «нет» и больше? Проверим бесплатно

Экспресс-аудит за 2 дня: прогоним базовые атаки на вашем боте и покажем доказанные находки, а не теорию.

Записаться на экспресс-аудит