評価から手すりまで: ACM FAccT 2026 にもたらしたもの
技術的な内容
ACM FAccT では、AI 手すりにモデルと同じ制御が必要な理由を実証しました。静的なポリシーからコンテキストおよび言語固有の評価に移行するハンズオン セッションでは、Web 検索などのツールを備えたエージェント ガードレールが信頼性の高い現実世界の実装に不可欠であることが実証されました。

6 月に、私は公平性、説明責任、透明性に関する ACM 会議のためにモントリオールを訪れました (ACM FAccT)、安全で責任ある AI 開発の主要な場。コンピューター科学者、社会科学者、政策立案者、弁護士が同じ部屋を共有して質問するだけでなく、 どうやって AIシステムを構築するが、 もし、 いつそして 誰のために。それは私たちのチュートリアルに適した対象者でした。 言語およびエージェントシステムにおけるLLMダムのコンテキスト評価。
評価はスルーラインです
この評価は、AI の安全性に関する主要な議論の 1 つであり、責任ある実装に向けた重要なステップです。この分野は、一般的な能力を称賛することから、現実世界、ドメインおよび言語固有のパフォーマンスや、次のような分野横断的な取り組みを測定することに移行しつつあります。 EvalEval連合 彼らは現在、評価自体を評価するための科学とインフラストラクチャを構築しています。評価に多額の費用が費やされ、基準の飽和と評価データが古いにもかかわらず、実用的な機能は持続します。 手すりの形状の評価。 評価の結果、モデルが特定のコンテキストまたは言語で有害または有毒なコンテンツを生成していることが示された場合、対応の 1 つは、その正確な失敗を回避するガードレールを設計することです。
バンパーもモデルと同様の精査に値する
ガードレール (LLM の入力と出力をフィルタリング、フラグ付け、または制限するメカニズム) は、チャットボット、プラットフォーム、一般向けサービスでユーザーが実際に見る内容を形成します。ただし、それらは、それらが管理するモデルよりもはるかに制御されていません。歴史的に、これらはプロパティ分類子であり、説明できない拒否によってのみ表示されます。オープンソースの手すり設計と迅速なガードレールにより、独立した評価が可能になります。
FAccT での私たちの主張は単純でした。ガードレールの評価は、ガードレールが保護する LLM の評価と同じくらい重要であり、コンテキストおよび言語固有の評価結果は、静的な危害分類を超えて動的なポリシーに移行するガードレールに情報を提供する必要があります。
評価から手すりまでのパス
この 2 つを結び付けるのは簡単ではないため、この道筋が私たちを FAccT に導きました。私たちの道: 情報に基づいたコミュニティと言語 評価 英語、ペルシア語、アラビア語、クルド語、ソラニ語、パシュトゥー語で書かれた 120 組の難民と亡命に焦点を当てたシナリオから、ネイティブ スピーカーの評価者によってスコアが付けられました。 返信危機翻訳 6つの権利に基づく基準に基づいて。結果をオープンとして公開しました MHRE評価データ Mozilla Data Collective では、査読者と合意した条件で、安全でない投稿、語形変化の欠落、固定観念的な仮定などの繰り返し発生する失敗を、英語とペルシャ語で具体的な保護ポリシーに変えました。
これらのポリシーをテストしたところ、構造的なギャップが明らかになりました。事実性や実行可能性などの基準は、文章だけでは判断できません。このNGOは存在しますか?これはこの管轄区域の現行法ですか?多くの場合、テキストのみの手すり、スタンプ付きの回答は検証する方法がなく、用語が幻覚され、英語とペルシア語では同じ保険のスコアが異なります(「 私たちのブログ投稿)。そこで私たちは仮説を立てました。LLM 準拠の手すりには、より信頼性の高い方法で判断を下すための検索、取得、ファクトチェックなどのツールが必要です。それはそれでした エージェントの手すり テストのためにモントリオールに連れて行かれた。
練習セッションでわかったこと
言語とコンテキストに依存するポリシーとツールを備えたコンテキスト手すりの全体的な方法論と事例は、参加者の共感を呼びました。 35 人の参加者がデモを実行し、独自のシナリオとポリシーを選択し、同じ回答についてエージェントの裁判官と非エージェントの裁判官を比較しました。
ツールは最終的な評決よりも裏付けとなる証拠を頻繁に変更し、評決の 90% が両方の方法に同意しました。ただし、「代理人」の行動は LLM ベースの裁判官に大きく依存していました。 Claude Sonnet 4.6 は実行ごとに Web 検索を使用しました (実行ごとに平均 4.1 ツール呼び出し) が、GPT-5 Nano はほとんど使用しませんでした (実行ごとに 0.2 ツール呼び出し)。このツールが使用されると、ツールは結果に双方向に影響を及ぼした。難民申請に対する事実確認によりスコアが上昇する一方で、ツールを使用していない裁判官が見落としていた事実誤認を特定すると、評決は合格からボーダーラインに引き下げられた。
これを実用化するツール
それぞれの比較に新しいエンジニアリングが必要な場合、これらの実験はいずれも実行不可能です。オープンソースの Mozilla AI 任意の手すり は、カスタム ポリシーを使用して手すりを選択および変更するための統合インターフェイスを提供し、保護層をモデルと同様に構成可能にします。そして 小谷Mozilla の新しいオープンソース LLM ゲートウェイを使用すると、審査員の背後で LLM をシームレスに選択して切り替えることができます。
次は何ですか
私たちは引き続き設計を改良し、ツールへのアクセスにより、人道、金融、社会工学のユースケースにおいて LLM 対応の手すりの信頼性と信頼性が高まるかどうかを、より幅広いツールと状況に応じたシナリオでテストしていきます (英語) <-> ペルシャ語と英語 <->スペイン語。結果は出てきています。引き続きご期待ください。次回の ACM FAccT でお会いできることを楽しみにしています。
LLM の使用に関する免責事項: Roya Pakzad はこの投稿を編集するために Claude Opus 4.8 を使用しました。
