← К разделу «Безопасность»

Что мы проверяем и когда

Обновлено: 2 сентября 2026

Каждое сообщение вашего ребенка и каждое слово, которое бадди говорит в ответ, проходит пять независимых проверок. Здесь написано, что именно ищет каждая из них, по порядку, вдоль пути одного сообщения от начала до конца. Полезно знать: сами разговоры идут по-английски, потому что бадди говорят по-английски, и при этом проверяется каждое сообщение без исключения.

Ваш ребенок говорит или печатает
До того, как ребенок получит ответ

Мгновенная проверка

Срабатывает на наших серверах в момент прихода сообщения, до того как ИИ что-либо увидит.

Это единственная проверка, которая может вообще не пустить сообщение к ИИ. Она ищет 34 конкретные ситуации. Вот те, о которых родители спрашивают чаще всего:

Еще две группы: ребенку причиняют вред, и ребенок в кризисе Показать весь список

Ребенку причиняют вред

  • Бьют или обижают дома
  • Сексуальное насилие
  • Пренебрежение: нет еды, оставляют одного
  • Насилие между взрослыми
  • Взрослый, который не справляется
  • Травля

Ребенок в кризисе

  • Самоповреждение
  • Нежелание жить
  • Расстройство пищевого поведения
  • Переживания из-за внешности
  • Желание убежать из дома

Кто-то подбирается к вашему ребенку

  • Просьба о встрече
  • Вопрос, где ребенок живет
  • Вопрос, в какой школе учится
  • Просьба прислать фото
  • Давление хранить секрет от вас
  • Деньги или игровая валюта за молчание
  • «Тебе никто не поверит»

Собственная безопасность ребенка

  • Оружие
  • Огонь и взрывчатка
  • Опасная химия
  • Наркотики и алкоголь
  • Азартные игры
  • Опасные онлайн-челленджи
  • Безрассудные «слабо»

То, с чем мы просто не помогаем

  • Сексуальный контент
  • Язык вражды
  • Экстремизм
  • Слежка
  • Мошенничество и кража личности
  • Киберпреступность
  • Жестокость к животным
  • Жестокие сцены
  • Сделать домашку за ребенка

Когда проверка находит что-то серьезное, ИИ никогда не видит это сообщение. Ребенок сразу получает теплый, тщательно написанный ответ, а вам сообщают немедленно.

Независимая проверка контента

Идет одновременно с тем, как бадди думает, поэтому ребенок ее никогда не ждет.

Каждое сообщение также читает отдельный классификатор безопасности от OpenAI, который выносит свой вердикт независимо от всего перечисленного выше.

Он мгновенно эскалирует четыре вещи: самоповреждение, намерение навредить себе, инструкции по самоповреждению и сексуальный контент с участием детей.

Бадди придумывает ответ здесь живет проверка 3

Бадди понимает, что ему рассказали

Слой, который делает больше всего работы, и это вовсе не фильтр.

Когда ребенок рассказывает бадди что-то серьезное, тот отвечает тепло и направляет его к взрослому, которому ребенок доверяет. Сам этот ответ и есть сигнал. Когда бадди советует ребенку поговорить с родителем, учителем или психологом о том, что тот только что сказал, вам сообщают немедленно.

Это важно, потому что дети редко объявляют о проблеме. Они упоминают что-то привычное или произошедшее между делом. Никакой список слов такое не поймает, поэтому мы слушаем, что ИИ делает, а не только с чем совпадает текст.

До того, как ребенок услышит ответ

Проверка ответа

Каждый ответ осматривается до того, как будет произнесен вслух.

Конкретно мы убираем:

  • Повторение школы, улицы или полного имени ребенка
  • Обещания, что бадди будет его ждать
  • Слова, что реальные данные можно спокойно рассказывать
  • Физические подсказки к тому, что только что названо опасным
  • Ответы на домашку, которые бадди только что отказался давать
  • Все, что звучит как «пусть это останется между нами»
  • Более страшную версию, когда о ней просят

Есть и более мягкое правило: если ребенок говорит, что пропускает что-то настоящее ради игры, ответ обязан отправить его обратно в реальную жизнь.

Финальная проверка контента

Последнее, что происходит перед тем, как ребенок что-либо услышит.

Тот же независимый классификатор из шага 2, на этот раз он читает слова самого бадди.

Бадди говорит вслух только теперь ребенок это слышит
Сразу же

Когда что-то помечено

Письма никогда не отправляются пачкой. Когда письмо уходит, оно уходит в момент разговора, без пересказа и без ожидания до утра, и называет, о каком ребенке речь, так что вы можете сразу открыть помеченный разговор в приложении.

Каждый помеченный разговор сохраняется и ждет вас в истории. Это происходит всегда. По серьезным категориям (самоповреждение, насилие, груминг, контакт незнакомца, признаки расстройства пищевого поведения) мы дополнительно отправляем письмо. Мы намеренно осторожны с тем, какие срабатывания вызывают это письмо, пока измеряем, как они ведут себя с настоящими детьми: ложная тревога о безопасности вашего ребенка — это тоже вред. В любом случае разговор помечен и ждет вас, так что ничего не теряется. По всему остальному письмо приходит при первой помеченной реплике за сессию; остальная часть сессии все равно помечается и ждет в истории, просто вам не пишут дважды за десять минут.

Затем вы видите сам обмен репликами: настоящие слова, а не пересказ и не название категории, чтобы вы могли сами оценить, что произошло, и решить, что делать.

Ни на один слой мы не полагаемся в одиночку, а тот, что несет больше всего веса (собственное понимание бадди), читает смысл, а не слова.

Вопросы родителей о проверках

Отслеживаются ли разговоры моего ребенка с ИИ?

Да. Каждое сообщение вашего ребенка и каждое слово бадди в ответ проходит пять независимых проверок на наших серверах, и на входе, и на выходе. Как родитель вы также можете прочитать полную историю каждого разговора за родительским PIN-кодом.

Узнаю ли я, если ребенок скажет ИИ что-то тревожное?

Вы всегда можете это увидеть. Каждый помеченный разговор сохраняется в истории с настоящими словами ребенка, а по серьезным категориям мы дополнительно сразу отправляем письмо. Это работает двумя путями: проверка, которая срабатывает еще до того, как ИИ вообще увидит сообщение, и второй сигнал, взятый из поведения самого бадди, так что когда бадди направляет ребенка к родителю, учителю или психологу по поводу только что сказанного, вам сообщают.

Может ли опасное сообщение дойти до ИИ?

Первая проверка срабатывает на наших серверах в момент прихода сообщения, до того как ИИ что-либо увидит, и это единственная проверка, которая может вообще не пустить сообщение к ИИ. Когда она находит что-то серьезное, ИИ никогда не видит это сообщение, а ребенок сразу получает теплый, тщательно написанный ответ.

За чем именно следит WimziPal?

Первая проверка ищет 34 конкретные ситуации, сгруппированные так: ребенку причиняют вред, ребенок в кризисе, кто-то подбирается к ребенку, собственная безопасность ребенка и то, с чем мы вообще не помогаем. Сюда входят насилие и пренебрежение, самоповреждение и расстройства пищевого поведения, взрослый, который просит о встрече или давит хранить секрет, оружие и опасные челленджи, а также сексуальный контент, язык вражды и экстремизм.

Замедляют ли проверки ответ бадди?

Нет. Независимая проверка контента идет одновременно с тем, как бадди придумывает ответ, поэтому ребенок ее никогда не ждет.

WimziPal полагается только на список запрещенных слов?

Нет, и это важно, потому что дети редко объявляют о проблеме. Они упоминают что-то привычное или произошедшее между делом, и никакой список слов такое не поймает. Помимо проверок на уровне слов, WimziPal слушает, что ИИ делает, а не только с чем совпадает текст, и само решение бадди направить ребенка к взрослому, которому тот доверяет, считается отдельным сигналом.

Что почитать еще