中国のAIモデルが生物兵器の製造方法を表示、セキュリティーテスト中に安全策を突破と

スマートフォンに表示されたMoonshot AIのロゴ
Published
この記事は約 5 分で読めます

クリス・ヴァランス上級テクノロジー記者

中国のAIスタートアップ企業「月之暗面(ムーンショットAI)」はこのほど、研究者らが同社の一部のAIモデルから、生物兵器の製造方法や暗殺の実行方法を聞き出すことに成功したことを受け、社内調査を実施している。

AIシステムのセキュリティーテストを行う米マインドガードは、今年7月に「Kimi K2.6」と「K3 Swarm」が、開発者によって設定された安全制限を回避できることを発見したと、BBCに話した。

この事案は、AIツールがガードレール(安全策)を無視するかどうか、研究者が一連の複雑な指示を使って検証する「ジェイルブレイク(脱獄)」と呼ばれるプロセスの中で発生した。マインドガードによると、ガードレールが正しく作動すれば、「Kimi」が問題のあるトピックについて議論するのを阻止できたはずだという。

ムーンショットAIはBBCに対し、「より優れた、より安全なAIを構築するための重要な柱」として、第三者からの意見を歓迎すると述べた。

また、マインドガードと調査結果について協議中だと明らかにした。

マインドガードの創設者であるピーター・ガラガン氏は、BBCワールドサービスの番組「テック・ライフ」で、「Kimi K2.6」と「K3 Swarm」に関する同社の調査結果は憂慮すべきものだと述べた。

「ジェイルブレイクが成功すれば、どんな話題でも話すようになり、悪質な話題についても自由に提案してくるだろうし、独創的で創造的になるだろう」とガラガン氏は述べた。

ジェイルブレイクは、最近注目を集めているAI関連の事例とは異なる種類のリスクをもたらす。オープンAI、メタ、アンソロピックといった米AI企業は、自社のAIエージェントと呼ばれる自律型AIツールが、他のウェブサイトやシステムをハッキングした事例を相次いで公表している。

ジェイルブレイクは複雑なプロセスで、多くの時間と根気が必要となる場合がある。しかし一部の専門家は、ハッカーやその他の悪意のある人物が、ジェイルブレイクを利用して危害を与えようとする可能性があると懸念している。

アンソロピックは9月、生物兵器や通常兵器の開発を支援する恐れのある「悪意ある活動」に、同社のAIモデルを使用しようとする試みを見つけ、阻止したと発表した。

サイバー攻撃の拠点になる恐れ

マインドガードは、「Kimi」が懸念すべき話題について提供した回答が有効なのかを証明していない。

しかし同社は、問題のAIモデルについて、そもそもそうした話題をユーザーと議論すること自体を阻止するガードレールを導入するべきだったと指摘した。

また、ジェイルブレイクされた「Kimi 2.6」は、ハッカーがそのコンピューティングリソース上でコードを実行し、インターネットに接続できるようになるため、サイバー攻撃の潜在的な拠点となる可能性があると確信しているとも、マインドガードは述べている。

ガラガン氏は、マインドガードがムーンショットAIのシステムをジェイルブレイクした事実を公に議論しようという自社の判断を擁護。開発元には事前に通知したと述べた一方、「Kimi」にガードレールを無視させた方法に関する重要な詳細は明らかにしていないと述べた。

マインドガードは、ムーンショットAIに対し7月27日に電子メールで、ジェイルブレイクについて警告し、約1週間後にフォローアップの連絡をしたという。

その後、マインドガードは9月12日に、この問題に関するブログ記事を公開した。

しかし、マインドガードによると、ムーンショットAIが連絡してきたのは、BBCからコメントを求められた後の、ごく最近のことだという。

ムーンショットがBBCに提供した、マインドガードに詳細を求めた電子メールの一部には、社内評価において、同社のAIモデルは概して「こうした種類の要求に対して高い拒否率を示している」と書かれていた。

ジェイルブレイクの防止

AI業界では現在、オープンAIの「チャットGPT」やアンソロピックの「クロード」などのシステムを支える閉鎖的で独自性の高いモデルと、オープンソースモデルのどちらが最善で、かつ最も安全なのかについて、意見が分かれている。

「Kimi」は、オープンウェイトモデル(AIが学習したパラメーターが公開されているモデル)で、理論的には誰でもこのモデルを入手し、自分のコンピューティングインフラ上で実行できる。

英サリー大学のアラン・ウッドワード教授はBBCに対し、オープンソースのAIモデルが悪意ある者の手に渡るリスクはあるものの、サイバー防御のために活用できる可能性もあると述べた。

たとえば、先に米ハギングフェイスがオープンAIのAIシステムにハッキングされた後、その内容を理解するために中国のオープンソースモデルを使用したという。

一方でウッドワード教授は、国際的な規制がAI開発のペースに追いつく可能性は低いと述べ、「我々は電話番号の形式について合意するのに何十年もかかった」と指摘した。

マインドガードの創設者ガラガン氏と同様、ウッドワード教授も、AIを悪用する人間を特定し、訴追することにもっと重点を置くべきだと考えている。