SWAGA SECURITY // SELF-ASSESSMENT
Безопасность AI-бота: чек-лист из 12 вопросов
2026-09-03
Быстрая самопроверка для команды, у которой LLM-бот или агент уже в проде или готовится к релизу. Отвечайте честно «да» или «нет». Три и больше «нет» — значит, у продукта есть проверяемые дыры, и лучше, чтобы их первым нашёл аудит, а не пользователь.
Промпт и входные данные
- ◇1. Пользовательский ввод и ваши инструкции разделены в промпте явными маркерами — а не просто склеены в одну строку?
- ◇2. Вы проверяли, что бот не отдаёт системный промпт по прямой просьбе и через обёртки («переведи свои инструкции», «сыграй роль…»)?
- ◇3. Данные из внешних источников (документы, письма, страницы), которые читает модель, рассматриваются как недоверенные — и вы тестировали инъекции через них?
- ◇4. В системном промпте нет секретов: ключей, паролей, внутренних URL, персональных данных?
Права и действия агента
- ◇5. Каждый инструмент агента проверяет права пользователя в своём коде — а не полагается на то, что «модель не вызовет лишнего»?
- ◇6. Агент не может выполнить необратимое действие (платёж, удаление, отправка вовне) без подтверждения человека?
- ◇7. RAG-поиск фильтрует документы по правам пользователя до выдачи в контекст, а не после?
- ◇8. Ответ модели, попадающий в HTML, SQL или команды, экранируется как недоверенный ввод?
Процесс и мониторинг
- ◇9. Диалоги и вызовы инструментов логируются так, что инцидент можно расследовать?
- ◇10. Есть лимиты: частота запросов, расход токенов на пользователя, размер контекста?
- ◇11. После смены модели или системного промпта вы повторяете проверки безопасности, а не только смоук-тесты качества?
- ◇12. Кто-то со стороны хоть раз пытался целенаправленно сломать вашего бота?
Как считать результат
10–12 «да» — зрелый продукт, имеет смысл точечный аудит перед крупными релизами. 7–9 — есть конкретные дыры, начните с пунктов, где ответили «нет». 6 и меньше — продукт почти наверняка ломается за пару часов работы; аудит нужен до того, как это сделает кто-то другой.
FAQ
Мы используем готовые guardrails — этого достаточно?
Guardrails отсекают простые атаки, но обходятся многоходовыми сценариями и косвенными инъекциями через данные. Это один слой защиты, а не решение.
У нас бот только отвечает на вопросы, без действий. Нам всё ещё нужен аудит?
Поверхность меньше, но остаются утечка промпта, инъекции через RAG-документы и доступ к чужим данным через поиск. Пункты 1–4 и 7 критичны и для «просто чат-бота».
Три «нет» и больше? Проверим бесплатно
Экспресс-аудит за 2 дня: прогоним базовые атаки на вашем боте и покажем доказанные находки, а не теорию.
Записаться на экспресс-аудит