> ## Documentation Index
> Fetch the complete documentation index at: https://docs.hiperai.com/llms.txt
> Use this file to discover all available pages before exploring further.

# ナレッジベースとRAG

# ナレッジベースと RAG システム

SecureAI は **検索拡張生成 (RAG)** を使用して AI モデルをプライベート データおよびドキュメントに接続し、安全かつ正確でコンテキストを認識した応答を保証します。

***

## RAG とは何ですか?

**検索拡張生成 (RAG)** は、言語モデルと外部知識ソースを組み合わせる AI 技術です。モデルの事前トレーニングされたデータのみに依存するのではなく、次のようにします。

1. **クエリ処理**: システムはユーザー プロンプトを分析して、関連する知識要件を特定します。
2. **ナレッジの取得**: セマンティック検索は、インデックスから関連するドキュメントのチャンクを取得します。
3. **コンテキスト拡張**: 取得されたコンテキストがモデル プロンプトに挿入されます。
4. **回答の生成**: AI は、文書を引用した事実に基づいた回答を生成します。

***

## SecureAI のインデックス タイプ

インデックスは、アクセシビリティごとに分類された構造化された知識ベースです。

| インデックスの種類       | 範囲     | アクセスとプライバシー                                       | 最適な用途                             |
| --------------- | ------ | ------------------------------------------------- | --------------------------------- |
| **個人的なインデックス**  | 個人ユーザー | エンドツーエンドで暗号化されます。ゼロ知識ストレージ (管理者でも内容を読み取ることができません) | 個人的なメモ、個人的な研究、個々のプロジェクトの文書        |
| **グループインデックス**  | チーム/部門 | グループ メンバーシップによって制御される役割ベースのアクセス                   | 部門の Wiki、チーム プロジェクトのドキュメント、共有 SOP |
| **グローバルインデックス** | 組織全体   | すべての企業ユーザーの読み取りアクセス                               | 会社方針、人事ガイドライン、全社マニュアル             |

### 1. 個人インデックス

* **ゼロ知識プライバシー**: ファイルと会話はテナント/ユーザー キーで暗号化されます。
* **作成**:
  * **ユーザー**: チャット インターフェイスを開き、モデル ピッカーの横にあるインデックス セレクターをクリックし、*個人* タブに切り替えて、**+** をクリックします。
  * **管理者**: **管理者に移動しますか?インデックス管理 ?インデックス**を作成し、特定のユーザーに割り当てます。

### 2. グループインデックス

* **コラボレーション**: 複数のチーム メンバーが同じナレッジ ベースに対してドキュメントをクエリしたり投稿したりできます。
* **作成**:
  * **管理者に移動しますか?グループ経営？グループ**を作成し、メンバーを割り当て、共有グループインデックスをリンクします。

### 3. グローバルインデックス

* **全社標準**: 企業のコンプライアンス、法的条件、および運用ガイドラインのための集中リポジトリ。
* **作成**: **管理者に移動しますか?インデックス管理 ?インデックス**を作成し、スコープを**グローバル**に設定します。

***

## インデックス作成の仕組み

ファイル (PDF、Word ドキュメント、CSV、JSON、Markdown、またはプレーン テキスト) をアップロードする場合:

`生の文書 --?  テキスト抽出 --?  セマンティックチャンキング --?  ベクトル埋め込み --?  ベクトルストレージ (インデックス)`

1. **ドキュメント処理**: テキストとメタデータ (タイムスタンプ、ファイル名) が抽出され、クリーニングされます。
2. **チャンキング**: コンテンツは、文脈上の連続性を維持するために重複を伴う最適化されたセマンティック チャンクに分割されます。
3. **埋め込み生成**: チャンクは高次元ベクトル埋め込みに変換されます。
4. **ベクター ストレージ**: 埋め込みは、類似性を即座に検索できるように、高性能ベクター データベースに保存されます。

***

## ベストプラクティス

* **名前付け**: インデックスとアップロードされたファイルには明確でわかりやすい名前を使用します (例: doc1 の代わりに HR-Policy-2026)。
* **ファイルの準備**: アップロードされたドキュメントがクリア テキストであることを確認します。アップロードする前に低品質のスキャンをクリーンアップします。
* **ファイル制限**: 標準アップロードでは、バッチあたり最大 10MB のファイルがサポートされます。
* **適切な範囲**: 機密の個人メモを個人インデックスに保存します。チーム リソースをグループ インデックスに移動します。
