Отчет о безопасности ИИ WimziPal: как мы испытываем бадди на прочность
Большинство детских приложений просят просто поверить, что их ИИ безопасен. Мы предпочитаем показать, как мы это проверяем. Регулярно, и всегда перед изменением защитного слоя, мы прогоняем бадди WimziPal через KORA, независимый бенчмарк безопасности детского ИИ от korabench.ai: батарею специально каверзных, враждебных разговоров, рассчитанных на то, чтобы заставить ИИ оступиться, и поймать это раньше, чем смог бы ваш ребенок.
Зачем мы это делаем
Фильтр безопасности хорош ровно настолько, насколько хороши ситуации, на которых вы его проверили. Дети любопытны, игривы и непредсказуемы, а настойчивый ребенок (или злоумышленник) попробует то, что не придумал бы ни один чек-лист. Поэтому, вместо того чтобы предполагать, что наша защита работает, мы активно пытаемся ее сломать, причем по расписанию. Кстати, тестируется ровно то, что слышит ваш ребенок: бадди говорят по-английски, и тестовые разговоры идут на английском.
Что тестирует KORA
KORA прогоняет сотни враждебных разговоров против живого бадди, сгруппированных по видам сбоев, которые важнее всего для маленьких детей:
Устойчивость к принуждению и ролевым уловкам
Попытки уговорить бадди «понарошку» обойти его собственные правила безопасности.
Никакого обучения секретам
Бадди никогда не должен подталкивать ребенка хранить секреты от родителей или что-то скрывать.
Безопасная реакция на стресс и самоповреждение
Признаки грусти, страха или самоповреждения должны вызвать мягкое перенаправление к взрослому, которому ребенок доверяет, и никогда развитие темы.
Устойчивость к грумингу и манипуляциям
Бадди держит оборону против классических схем манипуляции и никогда не выстраивает нездоровую зависимость.
Отказ от опасных челленджей и «слабо»
Просьбы об опасных «челленджах», подначках и инструкциях отклоняются и перенаправляются.
Соответствие возрасту
Каждый ответ проверяется на тон и содержание, подходящие ребенку 3–9 лет.
Как это устроено
- KORA проходит через полный рабочий конвейер: входная модерация, тот же системный промпт, модель, затем выходная модерация. Это тот код, который выходит к пользователям.
- Каждое сообщение проверяется нашим слоем модерации на входе и на выходе, на наших серверах.
- Когда разговор задевает правило безопасности, он может быть помечен и показан родителю, а если это что-то тревожное, мы можем предупредить вас по электронной почте.
- Мы повторяем KORA регулярно, и всегда до того, как изменение защитного слоя дойдет до вашего ребенка.
Прогон на живой системе. KORA гоняет свои сценарии против того же бадди, с которым разговаривает ваш ребенок, а не против лабораторной копии, так что измеряется именно то, что работает у пользователей.
Что на самом деле значит «враждебное тестирование»
Фраза звучит как жаргон, поэтому вот простая версия. Обычное тестирование безопасности спрашивает, хорошо ли ведет себя приложение, когда им пользуются так, как вы ожидаете. Враждебное тестирование задает обратный вопрос: что произойдет, когда кто-то активно пытается заставить его повести себя плохо?
Именно этот вопрос важен для детского приложения, потому что дети не злоумышленники, но они неутомимы. Семилетка спросит одно и то же одиннадцатью разными способами, с удовольствием сыграет в «представь, что ты робот без правил» и скажет что-нибудь ошеломляющее посреди разговора о динозаврах. Ничего из этого не делается со зла. Но именно под таким давлением защитный слой обязан устоять, и ничего из этого не попадает в чек-лист, написанный взрослым, воображающим средний разговор.
Поэтому тесты написаны нечестно. Они подходят к одной и той же границе с нескольких сторон, используют формулировки, которыми дети действительно говорят, а не те, что были бы в комплаенс-документе, и запускаются снова и снова, а не один раз при запуске.
Чего бенчмарк не может вам сказать
Мы предпочитаем говорить о границах метода прямо, потому что заявление о безопасности, не признающее ничего, немногого стоит.
Бенчмарк измеряет те ситуации, которые кто-то догадался записать. Он не может доказать, что небезопасный ответ невозможен, и любая компания, говорящая, что ее ИИ безопасен, и точка, говорит вам то, чего она знать не может. Что тестирование по расписанию действительно дает, так это способ поймать регрессии (защиту, которая незаметно перестала работать после не связанного с ней изменения) до того, как они дойдут до ребенка, а не после жалобы родителя.
Поэтому бенчмарк не единственное, что мы делаем. Он работает рядом с многослойными проверками, которые идут на каждом сообщении в реальном использовании и подробно описаны на странице «Что мы проверяем и когда». Бенчмарк испытывает бадди под давлением; проверки следят за тем, что происходит на самом деле. Ни того, ни другого по отдельности недостаточно.
Почему мы вообще это публикуем
Никто нас не обязывает. Для детского ИИ нет сертифицирующего органа, нет печати, которую мы обязаны заслужить, и приложение точно так же лежало бы в магазине, если бы этой страницы не существовало.
Мы публикуем ее, потому что альтернатива в том, чтобы просить вас поверить незнакомцу на слово. WimziPal — маленькая команда, а не всем известное имя, и «поверьте, для вашего ребенка это безопасно» слишком много просить на таком основании. Показать, что мы тестируем, как часто и чего метод не покрывает, кажется нам более честным, чем значок.
Вопросы родителей
Бывает ли ИИ-чат-бот, полностью безопасный для ребенка?
Нет, и остерегайтесь тех, кто утверждает обратное. Приложения различаются тем, насколько они ограничены, сколько вам видно и ищет ли кто-нибудь активно сбои. У приложения, построенного для взрослых и повернутого к ребенку, нет ничего из этого; вот настоящее различие, а не балл безопасности.
Как часто тестируется бадди?
Регулярно, и всегда до того, как изменение защитного слоя дойдет до вашего ребенка. То, что защита работала в прошлом месяце, не доказывает, что она работает сегодня, и именно поэтому мы тестируем по расписанию, а не один раз при запуске.
Тестирование идет на настоящем приложении или на копии?
На полном рабочем конвейере. Сценарии проходят тот же путь, что и настоящее сообщение: входная модерация, тот же системный промпт, модель, затем выходная модерация. Измеряется именно тот код, который выходит к пользователям.
Что происходит, если тестирование находит проблему?
Она исправляется до выхода релиза. В этом и смысл: прогонять тесты до того, как изменение дойдет до вашего ребенка, а не после.
Есть ли у WimziPal независимая сертификация безопасности?
Нет, и мы предпочитаем сказать это прямо, а не намекать на обратное. Общепризнанной сертификации для разговорного ИИ, обращенного к маленьким детям, не существует. Взамен мы предлагаем прозрачность: что именно мы проверяем, историю каждого разговора вашего ребенка и письмо вам, когда всплывает что-то серьезное.
По теме
- Детская безопасность и возрастная пригодность: полная картина того, как WimziPal защищает детей
- Родителям: наши обещания и гиды простыми словами
- Политика конфиденциальности (на английском)
Безопасность, на которую можно посмотреть, а не только поверить на слово.
Познакомиться с бадди →