4段階分類+ジェイルブレイク重要度フレームワーク、セーフティマージンも拡大。守るべき線を明文化した動き。
Fable 5のサイバーセーフガードとジェイルブレイク重要度フレームワークを公開
原題: More details on Fable 5’s cyber safeguards and our jailbreak framework
重要度の根拠: Fable 5の安全ガードレール仕様が開示され、セキュリティ・コンプライアンス判定に直結する情報が公開された実装者への実質的な指針となる
要約
AnthropicはClaude Fable 5の再デプロイに伴い、セキュリティ対策とジェイルブレイク(プロンプトを工夫してAIの安全機構を回避する手法)の重要度を測る枠組みを公開した。同社の安全分類器がサイバーセキュリティ関連で何をブロック・許可するか、また業界で合意のなかったジェイルブレイクの深刻度をどう定義するかについて、初期案を示している。HackerOneプログラムを立ち上げ、セキュリティ研究者から脆弱性報告を募集中。
要点
- Fable 5の安全分類器は4段階で鑑別;高リスク悪用から低リスク二重用途まで明確化
- ジェイルブレイク重要度フレームワーク初案を公開;業界初の統一定義案
- HackerOne脆弱性報告プログラム開始;報酬ベースでの検証体制確立
- セーフティマージンを拡大;保守的なバッファで誤検知抑制と有害出力防止の両立
- Glasswing等とのコラボで学界・産業・政府が共通言語で議論できる枠組み構築狙い
開発者向け技術解説(API・実装詳細・破壊的変更)を見る
Fable 5の安全分類器は4段階のサイバーセキュリティユースケース分類に対応。最危険度「high-risk deliberate cyberattacks」から最低リスク「low-risk dual use」まで、ユーザーリクエストをカテゴライズしてフィルタリング。アクセス制御、モデル安全性トレーニング、オフラインモニタリングと組み合わせた多層防御を採用。セーフティマージン(保守的なバッファ)を従来モデルより拡大し、偽陽性リスクを低減しつつ有害出力を抑止。cyber-safeguards@anthropic.comで枠組みへのフィードバック受付中。
本文の日本語訳(全文)を見る
Claude Fable 5は再デプロイされ、現在すべてのユーザーにグローバルで利用可能になっています。このタイミングで、2つの領域に関するさらなる情報を共有します。
第1に、モデルとともにローンチされたサイバーセキュリティ対策、特に安全分類器(Safety Classifiers)についての詳細情報を提供します。これらはモデルに付属するAIシステムであり、危険(または潜在的に危険な)サイバーセキュリティ用途を検出・ブロックします。ここでは、Fable 5の分類器が防ぐよう設計されている害のタイプ、および防ぐよう設計されていない害のタイプの詳細なリストを提供します。
第2に、Glasswinngパートナーと協力して進めてきた、提案するAIジェイルブレイク重要度フレームワークの初期案版を提示します。AIジェイルブレイクは、AIモデルにプロンプト工夫を通じてそのセーフガードをバイパスするよう促し、防ぎたい行動(危険またはおそらく危険なサイバーセキュリティタスクなど)のブロック解除を試みる、異例なプロンプト方法です。
ジェイルブレイクは重要度が異なります。些細な望ましくない行動のブロック解除のみの場合もあれば、有害出力の広範囲なブロック解除によってモデルをはるかに危険にする場合もあります。しかし、与えられたジェイルブレイクの重要度を説明するための合意されたフレームワークは存在していません。そのようなフレームワークがあれば、AI開発者は政府と(またはその逆に)、各ジェイルブレイクによってもたらされるリスクについて一貫性のある用語で会話できるようになります。
本日共有する内容は、現在の我々の考え方を反映しています。我々の希望は、学界、業界、市民社会、および政府にわたって、これらの線をどこに、どのように引くべきかについて、有益な議論を起こすことです。このフレームワークについてのフィードバックと批判をcyber-safeguards@anthropic.comでお待ちしています。また、セキュリティ研究者がFable 5で発見した潜在的なサイバージェイルブレイクを弊社の審査のため提出できるHackerOneプログラムもローンチしました。
協力することで、この技術の防御的利用を可能にしながら、その悪用を防止する標準を確立できると信じています。
サイバーセキュリティのような領域は、AI安全保障にとって特に困難です。これらは往々にして二重用途(Dual Use)だからです。つまり、多くのサイバーセキュリティ機能は、良い目的にも有害な目的にも使用できます。例えば、我々はサイバー防御者が自社のコードベースをスキャンしてソフトウェア脆弱性を発見するために我々のモデルを使用することを許可したいと思っています。しかし、この同じ機能は、間違った手に渡ると、サイバー攻撃の前身となりうるのです。
そのため、Fable 5についてすべてのサイバーセキュリティ関連活動をブロックすることは意図していません。代わりに、安全分類器を訓練して、最も明確に潜在的に危険から最も明確に潜在的に良性まで、4つのカテゴリ間のサイバーセキュリティ使用を識別します。これらは下表に要約されています。
低リスク二重用途カテゴリは、Fable再デプロイ後のブログ記事で説明した「セーフティマージン」に相当部分が重なることに注意してください(その記事から図の一つを下に再掲)。セーフティマージンには、許可することを好む多くの良性用途が含まれていますが、慎重の念から我々がブロックする用途も含まれています。セーフティマージンは、リクエストが分類器をトリガーしないようにするために非常に明確に安全である必要があることを意味します。セーフティマージンのサイズを調整して、分類器が有害な行動をキャッチすることについてより大きな信頼を持つことができます(Fable 5について、我々はこのマージンを従来のモデルよりも大きくしました)。
分類器は、より広いセーフガードセットの1つの要素です。分類器に加えて、我々はアクセス制御、モデル安全性トレーニング、およびオフラインモニタリングを使用して、追加的なセーフティレイヤーを追加しています。
出典: https://www.anthropic.com/news/fable-safeguards-jailbreak-framework
媒体: Anthropic News
※本記事は Anthropic / Claude 関連の公開情報を基に AI (OpenAI GPT-4o-mini) が日本語で要約・分類した二次的著作物です。著作権法第32条の引用要件に基づき出典 URL を必ず併記しています。要約は AI 生成のため誤訳・誤解釈を含む可能性があります。詳細・正確な情報は必ず出典元の原文をご確認ください。