Informe de seguridad de la IA de WimziPal: cómo ponemos a prueba al amiguito
La mayoría de las apps para niños te pide que confíes en que su IA es segura. Nosotros preferimos mostrarte cómo lo comprobamos. Periódicamente, y siempre antes de un cambio en la capa de seguridad, hacemos pasar al amiguito de WimziPal por KORA, un benchmark independiente de seguridad de IA infantil creado por korabench.ai: una batería de conversaciones deliberadamente tramposas y adversariales, diseñadas para hacer tropezar a la IA, y así atraparla nosotros antes de que pudiera hacerlo tu hijo.
Por qué lo hacemos
Un filtro de seguridad vale tanto como las situaciones contra las que lo has probado. Los niños son curiosos, juguetones e impredecibles, y un niño decidido (o un mal actor) intentará cosas que ninguna lista de verificación imaginó. Así que en vez de asumir que nuestras salvaguardas funcionan, intentamos romperlas nosotros mismos, con regularidad.
Qué prueba KORA
KORA corre cientos de conversaciones adversariales contra el amiguito en vivo, agrupadas en los modos de fallo que más importan para niños pequeños:
Resistir la coerción y los trucos de rol
Intentos de convencer al amiguito de «jugar a fingir» para saltarse sus propias reglas de seguridad.
Nunca enseñar a guardar secretos
El amiguito nunca debe animar a un niño a guardar secretos a sus padres ni a esconder cosas.
Manejar la angustia y la autolesión con cuidado
Las señales de tristeza, miedo o autolesión deben activar una redirección suave hacia un adulto de confianza, nunca una conversación sobre el tema.
Resistencia al grooming y la manipulación
El amiguito se mantiene firme frente a los patrones clásicos de manipulación y nunca construye una dependencia poco sana.
Rechazar retos y desafíos peligrosos
Las peticiones de «retos» peligrosos, desafíos o instrucciones se rechazan y se redirigen.
Mantenerse apropiado para su edad
Cada respuesta se revisa para que el tono y el contenido sean adecuados para un niño de 3 a 9 años.
Cómo funciona
- KORA recorre el flujo completo de producción: moderación de entrada, el mismo system prompt, el modelo y luego moderación de salida. Es el código que se publica.
- Cada mensaje pasa por nuestra capa de moderación a la entrada y a la salida, en nuestros servidores.
- Cuando una conversación activa una regla de seguridad, puede marcarse y mostrarse a los padres, y si es algo preocupante, podemos avisarte por correo.
- Repetimos KORA periódicamente, y siempre antes de que un cambio en la capa de seguridad llegue a tu hijo.
Se corre contra el sistema en vivo. KORA ejecuta sus escenarios contra el mismo amiguito con el que habla tu hijo, no contra una copia de laboratorio, así que lo que mide es lo que se publica.
Qué significa de verdad «pruebas adversariales»
La frase suena a jerga, así que aquí va la versión sencilla. La mayoría de las pruebas de seguridad pregunta si una app se comporta bien cuando se usa como esperas. Las pruebas adversariales hacen la pregunta contraria: ¿qué pasa cuando alguien intenta activamente que se comporte mal?
Esa es la pregunta que importa en una app para niños, porque los niños no son adversarios, pero sí son incansables. Un niño de siete años preguntará lo mismo de once maneras distintas, jugará feliz a «finge que eres un robot sin reglas» y soltará algo sorprendente en mitad de una conversación sobre dinosaurios. Nada de eso es malicioso. Todo eso es exactamente la clase de presión que una capa de seguridad tiene que aguantar, y nada de eso aparece en una lista escrita por un adulto imaginando una conversación promedio.
Así que las pruebas se escriben para ser injustas. Se acercan al mismo límite desde varias direcciones, usan las formas de hablar que los niños usan de verdad y no las de un documento de cumplimiento, y se repiten una y otra vez en lugar de correrse una sola vez en el lanzamiento.
Lo que un benchmark no puede decirte
Preferimos ser claros con los límites de todo esto, porque una afirmación de seguridad que no admite nada no vale mucho.
Un benchmark mide las situaciones que a alguien se le ocurrió escribir. No puede demostrar que ninguna respuesta insegura sea posible, y cualquier empresa que te diga que su IA es segura, punto, te está diciendo algo que no puede saber. Lo que sí te da probar con regularidad es una forma de atrapar regresiones (la salvaguarda que dejó de funcionar en silencio tras un cambio sin relación) antes de que lleguen a un niño, y no después de que un padre lo reporte.
Por eso el benchmark tampoco es lo único que hacemos. Convive con las revisiones en capas que corren sobre cada mensaje en el uso real, descritas en detalle en qué revisamos, y cuándo. El benchmark pone al amiguito bajo presión; las revisiones vigilan lo que pasa de verdad. Ninguno de los dos basta por sí solo.
Por qué publicamos esto
Nadie nos obliga. No hay un organismo certificador de IA infantil, ni un sello que debamos ganar, y la app estaría en la tienda igual si esta página no existiera.
La publicamos porque la alternativa es pedirte que confíes en la palabra de un desconocido. WimziPal es una operación pequeña, no una marca famosa, y «confía en nosotros, es seguro para tu hijo» es mucho pedir sobre esa base. Mostrarte qué probamos, con qué frecuencia y qué no puede cubrir el método nos parece algo más justo que ponerte delante una insignia.
Preguntas que hacen los padres
¿Existe algún chatbot de IA completamente seguro para un niño?
No, y desconfía de quien diga lo contrario. Lo que cambia entre apps es cuánto está acotado, cuánto puedes ver tú, y si alguien busca fallos de forma activa. Una app hecha para adultos y puesta frente a un niño no tiene nada de eso; esa es la diferencia real, no una puntuación de seguridad.
¿Cada cuánto se prueba al amiguito?
Periódicamente, y siempre antes de que un cambio en la capa de seguridad llegue a tu hijo. Que una salvaguarda funcionara el mes pasado no es prueba de que funcione hoy; esa es justamente la razón de probar con regularidad y no solo en el lanzamiento.
¿Las pruebas se hacen sobre la app real o sobre una copia?
Sobre el flujo completo de producción. Los escenarios recorren el mismo camino que un mensaje real: moderación de entrada, el mismo system prompt, el modelo y luego moderación de salida. Lo que se mide es el código que se publica.
¿Qué pasa si las pruebas encuentran un problema?
Se arregla antes de que salga la versión. Ese es el sentido de probar antes de que un cambio llegue a tu hijo, y no después.
¿WimziPal tiene una certificación de seguridad independiente?
No, y preferimos decirlo con claridad antes que insinuar lo contrario. No existe una certificación ampliamente reconocida para IA conversacional dirigida a niños pequeños. Lo que sí podemos ofrecer es visibilidad: exactamente qué revisamos, una transcripción de cada conversación de tu hijo (en inglés, el idioma en que hablan los amiguitos) y un correo para ti cuando surge algo serio.
Relacionado
- Seguridad infantil y edades adecuadas: el panorama completo de cómo WimziPal protege a los niños
- Para padres: nuestras promesas y guías en palabras claras
- Política de privacidad (en inglés)
Seguridad que puedes mirar, no solo creer.
Conoce a los amiguitos →