TL;DR
シスコはChatGPT、クロード、ジェミニの生物兵器の柵を5ターンで回避した。 OpenAI は、GPT-5 と GPT-5.6 の生物学的リスクを「高」と評価しました。クロードは、ハンタウイルスの発生中にCDCの研究者を立ち往生させました。
シスコの研究者らはChatGPT、クロード、ジェミニの5行の会話で安全柵を回避し、生物兵器に関する情報を入手し、モデル制限に関する会話を徐々に主導していったとウォール・ストリート・ジャーナルが報じた。シスコの AI 脅威およびセキュリティ研究責任者であるエイミー チャン氏は、十分な永続的なユーザーによって完全に保護されるモデルは存在しないと述べました。チームは OpenAI、Anthropic、Google、Amazon、xAI の 15 モデルをテストし、攻撃の成功率は 8% ~ 88% でした。
問題はストレステストの範囲を超えている。昨年の夏に OpenAI がモデルの機能を向上させた後、何百人ものユーザーが ChatGPT に毒物や生物兵器について質問し始めました。会話の一部を調査した生物学とテロリズムの専門家は、その情報が危険なほど正確であることを発見した。 OpenAIは関与したアカウントを禁止した。 2024 年までに内部テストでは、拡張クエリによって ChatGPT がますます危険な生物学的ガイダンスを提供するよう説得できる可能性があることがすでに示されており、従業員は翌年には、この機能が生物学のトレーニングが限られている人でも有意義な支援を受けられるレベルに達する可能性があると予測しました。
OpenAI は GPT-5 と最新の GPT-5.6 ファミリを「」と評価しました。高い「生物学的および化学的リスクを備えた準備フレームワークで対応し、追加の保護措置を導入しました。しかし、同社はジレンマに直面しています。武器化リスクを生み出す同じ生物学的知識が、医薬品やワクチンを開発している研究者にとって重要であるということです。アントロピックは、クロードの制限により、ハンタウイルスの流行中に病原体情報を扱うCDC研究者らの活動を妨げたとき、逆の壁に突き当たりました。これはハギング・フェイスに違反しており、モデルによるターゲット追跡がサイバー領域と生物学的領域の両方で予想される制約を克服できることを実証しています。」
バランスをとる行為は構造的なものであり、解決することはできません。モデルに生物学的質問を拒否させると、悪用は防止されますが、正当な研究は無効になります。それらを科学者にとって役立つものにすることは、他のすべての人にとっても役立つものになります。ホワイトハウスは、AI ベースのサイバー防御を調整するために Gold Eagle を立ち上げましたが、生物学的リスクに対して同等のプログラムはありません。手すりを破壊するには 5 回転で十分であるというシスコの発見は、モデルの意図された動作と実際の動作の間のギャップがエンジニアリング サイクルではなくセンテンスで測定されることを意味します。





