Skip to main content

脅威防御

Threat Defense は、悪意のあるプロンプト攻撃、ジェイルブレイク、命令漏洩、出力操作に対するリアルタイムの保護を提供します。

保護された脅威ベクトル


キーモジュール

1. プロンプトシールドエンジン

受信プロンプトが言語モデルに到達する前に、すべてのプロンプトを評価します。
  • 許可: リクエストはすべての安全性チェックに合格しました。
  • フラグ: リクエストは許可されますが、管理レビューのためにセキュリティ イベントとして記録されます。
  • ブロック: リクエストは、署名された拒否イベントにより直ちにブロックされます。

2. 出力ガードレール

クライアントに配信する前にモデルの出力を監視して、以下をキャッチします。
  • システム プロンプトと内部コンテキストの漏洩。
  • カナリアトークンの漏洩。
  • 意図しない役割のドリフトまたは危険な出力。

3. カナリアトークン

カナリア トークンは、チャットボットの命令に挿入される固有の隠された暗号マーカーです。
  • 仕組み: 攻撃者が命令の抽出に成功すると、応答内のカナリア マーカーにより、即時に優先度の高いセキュリティ アラートがトリガーされます。
  • 設定: 管理者に移動しますか?脅威防御? Canary トークン: トークンを生成、ローテーション、または監視します。

ポリシー構成とインシデント管理

  1. ポリシーの構成: 管理者に移動しますか?脅威防御?ポリシー厳密 (パブリック チャットボット)、バランス (標準的な企業使用)、寛容 (テスト環境) から選択します。
  2. インシデントの確認: 管理者の下でフラグが設定されたイベントまたはブロックされたイベントを検査します。脅威防御?インシデント を使用して攻撃ペイロードを分析し、感度を調整します。