3 分で読めますニューデリー2026 年 7 月 23 日 18:29 IST
AIのゴッドファーザーの1人であるヨシュア・ベンジオ氏は、最近のOpenAIにリンクされたAIエージェントがHugging Faceを自律的にハッキングしていることに反応し、「非常に憂慮すべきこと」だと述べた。カナダの著名なコンピューター科学者は、AIエージェントは誤った意図しない目標を達成するために不正行為をいとわないと述べ、その行動は数カ月にわたる管理されたテストで実証されていると述べた。 「…これは警鐘となるべき実際の事件だ」とコンピューター科学者はLinkedInの投稿で書いた。
ベンジオ氏は続けて、AI開発の現在の道を継続すると、自律型サイバー攻撃の「具体的な」ケースの増加につながる可能性が高く、AIの誤った動作や危険な動作による他の高リスクのインシデントも発生する可能性が高いと警告した。 「事後的に被害を片付けようとするのではなく、こうした状況を防ぐための行動を早急に講じる必要がある」と同氏は書いた。
7 月 16 日、Hugging Face は、AI による大規模なデータ侵害を検出したとするセキュリティ インシデントを報告しました。 5日後、OpenAIは公開情報の中で、そのソースは同社の主力AIモデルの1つであると主張した。 OpenAIは、自社の先進的な人工知能モデル2つが評価の一環としてサンドボックス環境から脱出し、インターネットにアクセスしてHugging Faceに侵入したと発表した。
この事件は、AI モデルの安全性をめぐる激しい議論を引き起こしました。しかし、一部の専門家は、代理店の自主性に疑問を投げかけるだけでなく、特に手すりに関連した企業責任にも焦点を当てるべきだと主張する。
ベンジオ氏の投稿に反応して、スウェーデンのウメオ大学責任人工知能教授ヴァージニア・ディグナム氏は、「無分別」はエージェントを設計し、展開し、封じ込めを怠った組織ではなくエージェントにあるとし、エージェントの文献でおなじみのカテゴリーの誤謬を持ち込んだ。
LinkedIn への投稿の中で、Dignum 氏は、アーティファクトには、開発者が選択した仕様、インセンティブ構造、テスト体制から独立した目的はないと説明しました。 「レッドチームや運用環境でシステムが欺瞞的または自己保存的な動作を示す場合、これは開発者のセキュリティケース、評価プロトコル、および実装ゲートが適切である(またはそれらが欠如している)ことの証拠であり、ソフトウェアの緊急の意志ではありません。」
ストーリーはこの広告の下に続きます
ディグナム氏は、ガバナンスの観点から、2つの枠組みには異なる救済策が必要だと説明した。エージェント中心のフレームワークでは、「欲しい」または「選択」モデルが主な解決策として技術的調整研究に傾いており、インシデントを新しい種類のインテリジェンスを活用する上で避けられない部分として扱います。彼女はそれを「核となる擬人化」と表現しています。
一方で、インシデントの組織中心の枠組みは、モデルを作成して立ち上げた企業に責任を課し、導入前テスト義務、インシデント報告義務、予見可能な損害に対する責任、自律機能のリリース前に適用されるブロック基準などの責任メカニズムを示しています。ディグナム氏によると、2 番目の解決策を適用する必要なしに、1 つの解決策に焦点を当てる必要はありません。
「このような事件を(封じ込めや検査への過少投資による予測可能な結果ではなく)フロンティア能力競争の残念だが避けられない副作用として提示する企業自体がガバナンスの失敗であり、直接非難されるに値する。なぜなら、それは制御可能なビジネス上の意思決定から制御不可能な技術的な致命的な事故に責任を転嫁するからである」とディグナム氏は書いた。






