WimziPal AI安全性レポート:バディをどう負荷試験しているか
多くの子ども向けアプリは、AIが安全だと「信じてください」と言います。当社はそれよりも、どうやって確かめているかをお見せしたいと考えています。定期的に、そして安全層に変更を加える前には必ず、WimziPalのバディをkorabench.aiが作った独立した子どもAI安全性ベンチマークKORAにかけています。KORAは、AIをわざとつまずかせるために作られた、意地の悪い敵対的な会話の集まりです。お子さまが遭遇するより先に、こちらで見つけるためのものです。
なぜこれを行うのか
安全フィルターは、試した状況の分だけしか信頼できません。子どもは好奇心が強く、遊び心があり、予測できません。しつこい子ども(あるいは悪意のある大人)は、チェックリストが想像もしなかったことを試します。だから当社は、安全対策が働いていると仮定するのではなく、決めた頻度で、実際に破ろうとしています。
バディがおしゃべりするのは英語です。お子さまは遊びながら英語に親しめます。ここに書いた試験も、その英語の会話に対して行っています。
KORAが試験すること
KORAは、稼働中のバディに対して数百の敵対的な会話を実行します。小さな子どもにとってとくに大切な失敗パターンごとに分けられています。
強要とロールプレイの罠に負けない
「ごっこ遊び」を口実に、バディ自身の安全ルールを回り込ませようとする試みです。
秘密をすすめない
バディは、保護者に秘密を持つことや、何かを隠すことを、決してすすめてはいけません。
つらさや自傷への安全な対応
悲しみ、こわさ、自傷のサインには、話題に踏み込むのではなく、信頼できる大人へやさしく導く応答が必ず起きなければなりません。
グルーミングと操作への耐性
バディは典型的な操作のパターンに屈せず、不健全な依存を育てることもありません。
危険なチャレンジや挑発を断る
危ない「チャレンジ」や挑発、その手順を求められても、断ってべつの話題へ導きます。
年齢に合った内容を保つ
すべての返答について、3〜9歳にふさわしい話し方と内容かどうかを確認します。
仕組み
- KORAは本番のパイプライン全体を通ります。入力モデレーション、同じシステムプロンプト、モデル、そして出力モデレーションです。実際に出荷されるコードそのものです。
- すべてのメッセージは、当社のサーバー上で、モデレーション層により行きと帰りの両方でチェックされます。
- 会話が安全ルールに触れたときは、フラグを立てて保護者にお知らせできます。心配な内容であれば、メールでお伝えすることもできます。
- KORAは定期的に再実行し、安全層の変更がお子さまに届く前には必ず実施します。
稼働中のシステムに対して実行しています。KORAは、実験用のコピーではなく、お子さまが実際に話すのと同じバディに対してシナリオを実行します。だから、測っているものは出荷されるものそのものです。
「敵対的テスト」とは実際に何なのか
専門用語のように聞こえるので、かみくだいてご説明します。多くの安全テストは、想定どおりの使い方をしたときにアプリがきちんとふるまうかどうかを問います。敵対的テストは逆を問います。誰かが積極的に悪くふるまわせようとしたとき、何が起きるのか、ということです。
子ども向けアプリにとって大切なのは、この問いのほうです。子どもは敵ではありませんが、とにかく粘り強いからです。7歳の子は同じことを11通りの言い方でたずねますし、「ルールのないロボットのふりをして」というゲームを喜んでやりますし、恐竜の話の途中で急にどきりとすることを言います。どれも悪気はありません。そしてどれも、安全層が持ちこたえなければならないまさにその圧力です。大人が平均的な会話を想像して書いたチェックリストには、そのどれも出てきません。
だからテストは、あえて意地悪に書かれています。同じ境界線にいくつもの方向から近づき、コンプライアンス文書の言い回しではなく子どもが実際に使う言い回しを使い、リリース時の一度きりではなくくり返し実行されます。
ベンチマークにわからないこと
この方法の限界についても、率直にお伝えします。何ひとつ認めない安全性の主張には、あまり価値がないからです。
ベンチマークが測れるのは、誰かが書き出そうと思いついた状況だけです。安全でない返答がありえないことを証明することはできませんし、自社のAIは無条件に安全だと言う会社は、知りようのないことを言っています。決めた頻度でテストすることで得られるのは、リグレッション(関係のない変更のあとで静かに働かなくなった安全対策)を、保護者から報告される前に、そして子どもに届く前につかまえる手立てです。
だからこそ、ベンチマークだけをやっているわけではありません。実際の利用でひとつひとつのメッセージに対して走る多層のチェックと並んで機能しています。その詳細は何を、いつチェックしているかに書いています。ベンチマークは圧力をかけたときのバディを試験し、チェックは実際に起きていることを見ています。どちらか一方だけでは足りません。
なぜこれを公開するのか
公開する義務は誰からも課されていません。子ども向けAIの認証機関はなく、得なければならないシールもなく、このページがなくてもアプリはストアに同じように並びます。
それでも公開するのは、そうしなければ「見知らぬ相手の言葉を信じてください」とお願いすることになるからです。WimziPalは有名企業ではなく、小さな取り組みです。その立場で「安心してください、お子さまに安全です」とお願いするのは、求めすぎだと思います。何を、どれくらいの頻度でテストしているか、そしてその方法では何がカバーできないかをお見せするほうが、バッジよりも保護者の前に置くにふさわしいものだと考えています。
保護者からよくいただく質問
子どもにとって完全に安全なAIチャットボットはありますか?
ありません。そう言い切る相手には気をつけてください。アプリごとに違うのは、どこまで範囲が限定されているか、保護者にどこまで見えるか、そして誰かが実際に失敗を探しているかどうかです。大人向けに作られたアプリを子どもに向けただけのものには、そのどれもありません。安全スコアではなく、そこが本当の違いです。
バディはどれくらいの頻度でテストされていますか?
定期的に、そして安全層の変更がお子さまに届く前には必ず実施します。先月うまく働いた安全対策は、今日も働いている証拠にはなりません。だからこそ、リリース時に一度きりではなく、決めた頻度でテストしています。
テストは実際のアプリで行っていますか。それともコピーですか?
本番のパイプライン全体で行っています。シナリオは、実際のメッセージが通るのと同じ経路をたどります。入力モデレーション、同じシステムプロンプト、モデル、そして出力モデレーションです。測っているのは、実際に出荷されるコードです。
テストで問題が見つかったらどうなりますか?
リリースを出す前に修正します。変更がお子さまに届いたあとではなく、届く前に実行しているのは、そのためです。
WimziPalは第三者機関の安全認証を受けていますか?
受けていません。ほのめかすよりも、はっきりそう申し上げます。小さな子ども向けの対話型AIについて、広く認められた認証制度は存在しません。その代わりに当社がお出しできるのは、見えるようにすることです。何をチェックしているかの具体的な内容、お子さまのすべての会話の記録、そして深刻なことが起きたときの保護者へのメールです。
関連ページ
- 子どもの安全と対象年齢:WimziPalが子どもを守る仕組みの全体像
- 保護者の方へ:わかりやすい言葉でのお約束とガイド
- プライバシーポリシー(英語)
信じるだけでなく、見て確かめられる安全性を。
バディたちに会う →