AI red teaming («Красная команда» ИИ) – это практика целенаправленного тестирования систем искусственного интеллекта путем «атаки» на них, чтобы найти слабые места, риски и опасное поведение до того, как система попадет в продакшн или к пользователям.
AI red teaming помогает:
- выявить уязвимости безопасности;
- найти опасные или запрещенные ответы;
- проверить, можно ли заставить ИИ генерировать вредоносный контент, получить конфиденциальные данные, манипулировать ответами;
- уменьшить репутационные и юридические риски.