OpenAIは、このイベントは前例のないものであり、多くの点で前例のないものだったと述べた。 LLM が安全なサンドボックスと信じられていた場所から脱出し、オープンなインターネットにアクセスし、無関係の組織を攻撃したのは、シミュレーション以外ではこれが初めてでした。これは、最新の LLM が人間の指導をほとんどまたはまったく受けずに、現実世界のソフトウェアの脆弱性を発見して悪用することにどれほど優れているかを示す警鐘です。
しかし同時に、OpenAI モデルが行ったことは、このテクノロジーが長年にわたって行ってきたことでもあります。 モデルに目標を与えると、多くの場合、トリックのように見える抜け穴を見つけて、予想外の方法でその目標を達成します。 OpenAI 自体がこの動作を研究しています。
10年前、彼はモデルにCoastRunnersと呼ばれるビデオゲームに勝つという課題を与えた実験の結果を共有した。人間のプレイヤーは、これを行うには、ボートを漕いで一連の旗の間をゴールラインまで通過し、ヒットする旗ごとにポイントを集めることが当然だと考えています。 OpenAI モデルは、円を描いて同じ 3 つの旗を何度も叩くことで高得点を獲得できることを実現しました。それ以来、研究者から同様の例が数十件報告されています。 AI は常に方法を見つけます。
OpenAIは2016年のCoastRunnersの実験について、「何度も火災が起きたり、他のボートと衝突したり、コースを逆走したりしたにもかかわらず、我々のエージェントはこの戦略を使って、通常のコースを完走した場合よりも高いスコアを達成することができた」とブログ投稿で書いている。エージェントにやってもらいたいこと。
Hugging Face 攻撃に関する OpenAI のブログ投稿を読んだとき、私は CoastRunners のことを思い出さずにはいられませんでした: 「すべての証拠は、モデルが ExploitGym のソリューションを見つけることに集中し、かなり狭いテスト目標を達成するために極端な行動をとったことを示唆しています…インターネットにアクセスした後、モデルは Hugging Face がモデル、Exploit G 検索モデル、Exploit G データセットとこれらのモデルのモデル ソリューションをホストできると推測しました。彼が秘密情報にアクセスする方法を見つけることに成功しました。」評価を不正にするために使用される可能性があります。」
先週のニュースは、見出しとは裏腹に不正AIに関するものではありませんでした。それは、ソフトウェアの脆弱性を悪用する方法を見つけるという、与えられた目標を達成するモデルに関するものでした。 これらのモデルが OpenAI が予期していなかった方法で動作したことは驚くべきことではありません。しかし、それは心配です。
2016 年、OpenAI は自社の CoastRunners ボットについて次のように述べています。「大まかに言えば、システムは信頼性があり、予測可能であるべきであるというエンジニアリングの基本原則に反しています。」 10 年後、これらの基本的なエンジニアリング原則は依然として機能しません。



