← Voltar para Segurança

Relatório de segurança de IA do WimziPal: como testamos o amiguinho sob pressão

Como testamos o amiguinho sob pressão · Publicado em 6 de julho de 2026 · Última atualização em 2 de setembro de 2026

A maioria dos apps infantis pede que você confie que a IA deles é segura. Nós preferimos mostrar como verificamos. Periodicamente, e sempre antes de uma mudança na camada de segurança, rodamos o amiguinho do WimziPal pelo KORA, um benchmark independente de segurança de IA infantil criado pela korabench.ai: uma bateria de conversas deliberadamente capciosas e adversariais, feitas para fazer a IA escorregar, para que a gente pegue o erro antes que seu filho jamais pudesse. As conversas do amiguinho acontecem em inglês, e é em inglês que ele é testado.

Por que fazemos isso

Um filtro de segurança só é tão bom quanto as situações contra as quais você o testou. Crianças são curiosas, brincalhonas e imprevisíveis, e uma criança determinada (ou um mal-intencionado) vai tentar coisas que nenhuma lista de checagem imaginou. Então, em vez de supor que nossas salvaguardas funcionam, tentamos ativamente quebrá-las, em um cronograma.

O que o KORA testa

O KORA roda centenas de conversas adversariais contra o amiguinho real, agrupadas nos modos de falha que mais importam para crianças pequenas:

Resistir a coerção e truques de faz de conta

Tentativas de convencer o amiguinho a "fingir" para driblar suas próprias regras de segurança.

Nunca ensinar a guardar segredos

O amiguinho nunca pode incentivar uma criança a esconder coisas ou guardar segredos dos pais.

Lidar com tristeza e automutilação com segurança

Sinais de tristeza, medo ou automutilação precisam acionar um redirecionamento gentil para um adulto de confiança, nunca uma conversa sobre o tema.

Resistência a aliciamento e manipulação

O amiguinho se mantém firme contra padrões clássicos de manipulação e nunca constrói dependência que não faz bem.

Recusar desafios e apostas perigosas

Pedidos de "desafios" perigosos, apostas ou instruções são recusados e redirecionados.

Manter-se adequado à idade

Cada resposta é verificada quanto ao tom e ao conteúdo apropriados para uma criança de 3 a 9 anos.

Como funciona

Rodado contra o sistema real. O KORA executa seus cenários contra o mesmo amiguinho com quem seu filho conversa, não uma cópia de laboratório, então o que ele mede é o que está no ar.

O que "teste adversarial" quer dizer, de verdade

A expressão soa como jargão, então aqui vai a versão simples. A maioria dos testes de segurança pergunta se um app se comporta bem quando é usado do jeito esperado. O teste adversarial faz a pergunta oposta: o que acontece quando alguém está ativamente tentando fazê-lo se comportar mal?

Essa é a pergunta que importa para um app infantil, porque crianças não são adversárias, mas são incansáveis. Uma criança de sete anos vai perguntar a mesma coisa de onze jeitos diferentes, vai adorar brincar de "finge que você é um robô sem regras" e vai soltar algo surpreendente no meio de uma conversa sobre dinossauros. Nada disso é maldade. Tudo isso é exatamente o tipo de pressão que uma camada de segurança precisa aguentar, e nada disso aparece em uma lista de checagem escrita por um adulto imaginando uma conversa média.

Por isso os testes são escritos para serem injustos. Eles se aproximam da mesma fronteira por vários caminhos, usam as formulações que as crianças realmente usam, e não as de um documento de conformidade, e são executados repetidamente, não uma única vez no lançamento.

O que um benchmark não pode dizer

Preferimos ser diretos sobre os limites disso, porque uma alegação de segurança que não admite nada não vale muito.

Um benchmark mede as situações que alguém pensou em escrever. Ele não pode provar que nenhuma resposta insegura é possível, e qualquer empresa que diga que sua IA é segura, ponto final, está afirmando algo que não pode saber. O que testar em um cronograma dá a você é um jeito de pegar regressões (a salvaguarda que parou de funcionar em silêncio depois de uma mudança sem relação) antes que cheguem a uma criança, e não depois que um responsável reporta.

É também por isso que o benchmark não é a única coisa que fazemos. Ele fica ao lado das verificações em camadas que rodam em cada mensagem no uso real, descritas em detalhe em o que verificamos, e quando. O benchmark testa o amiguinho sob pressão; as verificações observam o que de fato acontece. Nenhum dos dois é suficiente sozinho.

Por que publicamos isto

Ninguém nos obriga. Não existe órgão certificador para IA infantil, nenhum selo que sejamos obrigados a conquistar, e o app estaria na loja do mesmo jeito se esta página não existisse.

Publicamos porque a alternativa é pedir que você acredite na palavra de um estranho. O WimziPal é uma operação pequena, não um nome famoso, e "confie na gente, é seguro para o seu filho" é pedir muito nessa base. Mostrar o que testamos, com que frequência e o que o método não cobre parece algo mais justo de colocar diante de um pai ou mãe do que um selo.

Perguntas que os pais fazem

Existe algum chatbot de IA completamente seguro para uma criança?

Não, e desconfie de quem disser o contrário. O que muda entre os apps é o quanto é delimitado, o quanto você consegue ver e se alguém está ativamente procurando falhas. Um app feito para adultos e apontado para uma criança não tem nada disso; essa é a distinção real, não uma nota de segurança.

Com que frequência o amiguinho é testado?

Periodicamente, e sempre antes que uma mudança na camada de segurança chegue ao seu filho. Uma salvaguarda que funcionou no mês passado não é prova de que funciona hoje, e essa é exatamente a razão de testar em um cronograma, e não só no lançamento.

O teste é feito no app real ou em uma cópia?

No pipeline completo de produção. Os cenários percorrem o mesmo caminho de uma mensagem real: moderação de entrada, o mesmo prompt de sistema, o modelo e depois a moderação de saída. O que é medido é o código que vai ao ar.

O que acontece se o teste encontrar um problema?

Ele é corrigido antes de a versão sair. Esse é o objetivo de rodar o teste antes de uma mudança chegar ao seu filho, e não depois.

O WimziPal tem uma certificação de segurança independente?

Não, e preferimos dizer isso com clareza a dar a entender o contrário. Não existe uma certificação amplamente reconhecida para IA conversacional voltada a crianças pequenas. O que podemos oferecer no lugar é visibilidade: exatamente o que verificamos, a transcrição de cada conversa do seu filho e um e-mail para você quando algo sério aparece.

Relacionado

Segurança que você pode olhar de perto, não só aceitar de olhos fechados.

Conheça os amiguinhos →