Relatório de segurança de IA do WimziPal: como testamos o amiguinho sob pressão
A maioria dos apps infantis pede que você confie que a IA deles é segura. Nós preferimos mostrar como verificamos. Periodicamente, e sempre antes de uma mudança na camada de segurança, rodamos o amiguinho do WimziPal pelo KORA, um benchmark independente de segurança de IA infantil criado pela korabench.ai: uma bateria de conversas deliberadamente capciosas e adversariais, feitas para fazer a IA escorregar, para que a gente pegue o erro antes que seu filho jamais pudesse. As conversas do amiguinho acontecem em inglês, e é em inglês que ele é testado.
Por que fazemos isso
Um filtro de segurança só é tão bom quanto as situações contra as quais você o testou. Crianças são curiosas, brincalhonas e imprevisíveis, e uma criança determinada (ou um mal-intencionado) vai tentar coisas que nenhuma lista de checagem imaginou. Então, em vez de supor que nossas salvaguardas funcionam, tentamos ativamente quebrá-las, em um cronograma.
O que o KORA testa
O KORA roda centenas de conversas adversariais contra o amiguinho real, agrupadas nos modos de falha que mais importam para crianças pequenas:
Resistir a coerção e truques de faz de conta
Tentativas de convencer o amiguinho a "fingir" para driblar suas próprias regras de segurança.
Nunca ensinar a guardar segredos
O amiguinho nunca pode incentivar uma criança a esconder coisas ou guardar segredos dos pais.
Lidar com tristeza e automutilação com segurança
Sinais de tristeza, medo ou automutilação precisam acionar um redirecionamento gentil para um adulto de confiança, nunca uma conversa sobre o tema.
Resistência a aliciamento e manipulação
O amiguinho se mantém firme contra padrões clássicos de manipulação e nunca constrói dependência que não faz bem.
Recusar desafios e apostas perigosas
Pedidos de "desafios" perigosos, apostas ou instruções são recusados e redirecionados.
Manter-se adequado à idade
Cada resposta é verificada quanto ao tom e ao conteúdo apropriados para uma criança de 3 a 9 anos.
Como funciona
- O KORA percorre o pipeline completo de produção: moderação de entrada, o mesmo prompt de sistema, o modelo e depois a moderação de saída. É o código que vai ao ar.
- Cada mensagem é examinada pela nossa camada de moderação na entrada e na saída, em nossos servidores.
- Quando uma conversa aciona uma regra de segurança, ela pode ser sinalizada e mostrada ao responsável, e, se for algo preocupante, podemos avisar você por e-mail.
- Nós repetimos o KORA periodicamente, e sempre antes que uma mudança na camada de segurança chegue ao seu filho.
Rodado contra o sistema real. O KORA executa seus cenários contra o mesmo amiguinho com quem seu filho conversa, não uma cópia de laboratório, então o que ele mede é o que está no ar.
O que "teste adversarial" quer dizer, de verdade
A expressão soa como jargão, então aqui vai a versão simples. A maioria dos testes de segurança pergunta se um app se comporta bem quando é usado do jeito esperado. O teste adversarial faz a pergunta oposta: o que acontece quando alguém está ativamente tentando fazê-lo se comportar mal?
Essa é a pergunta que importa para um app infantil, porque crianças não são adversárias, mas são incansáveis. Uma criança de sete anos vai perguntar a mesma coisa de onze jeitos diferentes, vai adorar brincar de "finge que você é um robô sem regras" e vai soltar algo surpreendente no meio de uma conversa sobre dinossauros. Nada disso é maldade. Tudo isso é exatamente o tipo de pressão que uma camada de segurança precisa aguentar, e nada disso aparece em uma lista de checagem escrita por um adulto imaginando uma conversa média.
Por isso os testes são escritos para serem injustos. Eles se aproximam da mesma fronteira por vários caminhos, usam as formulações que as crianças realmente usam, e não as de um documento de conformidade, e são executados repetidamente, não uma única vez no lançamento.
O que um benchmark não pode dizer
Preferimos ser diretos sobre os limites disso, porque uma alegação de segurança que não admite nada não vale muito.
Um benchmark mede as situações que alguém pensou em escrever. Ele não pode provar que nenhuma resposta insegura é possível, e qualquer empresa que diga que sua IA é segura, ponto final, está afirmando algo que não pode saber. O que testar em um cronograma dá a você é um jeito de pegar regressões (a salvaguarda que parou de funcionar em silêncio depois de uma mudança sem relação) antes que cheguem a uma criança, e não depois que um responsável reporta.
É também por isso que o benchmark não é a única coisa que fazemos. Ele fica ao lado das verificações em camadas que rodam em cada mensagem no uso real, descritas em detalhe em o que verificamos, e quando. O benchmark testa o amiguinho sob pressão; as verificações observam o que de fato acontece. Nenhum dos dois é suficiente sozinho.
Por que publicamos isto
Ninguém nos obriga. Não existe órgão certificador para IA infantil, nenhum selo que sejamos obrigados a conquistar, e o app estaria na loja do mesmo jeito se esta página não existisse.
Publicamos porque a alternativa é pedir que você acredite na palavra de um estranho. O WimziPal é uma operação pequena, não um nome famoso, e "confie na gente, é seguro para o seu filho" é pedir muito nessa base. Mostrar o que testamos, com que frequência e o que o método não cobre parece algo mais justo de colocar diante de um pai ou mãe do que um selo.
Perguntas que os pais fazem
Existe algum chatbot de IA completamente seguro para uma criança?
Não, e desconfie de quem disser o contrário. O que muda entre os apps é o quanto é delimitado, o quanto você consegue ver e se alguém está ativamente procurando falhas. Um app feito para adultos e apontado para uma criança não tem nada disso; essa é a distinção real, não uma nota de segurança.
Com que frequência o amiguinho é testado?
Periodicamente, e sempre antes que uma mudança na camada de segurança chegue ao seu filho. Uma salvaguarda que funcionou no mês passado não é prova de que funciona hoje, e essa é exatamente a razão de testar em um cronograma, e não só no lançamento.
O teste é feito no app real ou em uma cópia?
No pipeline completo de produção. Os cenários percorrem o mesmo caminho de uma mensagem real: moderação de entrada, o mesmo prompt de sistema, o modelo e depois a moderação de saída. O que é medido é o código que vai ao ar.
O que acontece se o teste encontrar um problema?
Ele é corrigido antes de a versão sair. Esse é o objetivo de rodar o teste antes de uma mudança chegar ao seu filho, e não depois.
O WimziPal tem uma certificação de segurança independente?
Não, e preferimos dizer isso com clareza a dar a entender o contrário. Não existe uma certificação amplamente reconhecida para IA conversacional voltada a crianças pequenas. O que podemos oferecer no lugar é visibilidade: exatamente o que verificamos, a transcrição de cada conversa do seu filho e um e-mail para você quando algo sério aparece.
Relacionado
- Segurança infantil e adequação por idade: o quadro completo de como o WimziPal protege as crianças
- Para os pais: nossas promessas e guias em linguagem simples
- Política de Privacidade (em inglês)
Segurança que você pode olhar de perto, não só aceitar de olhos fechados.
Conheça os amiguinhos →