ドキュメント作成チーム
読者は製品ガイドの用語を使わずに問題を説明します。
短いセクションを見出しとともに埋め込み、検索結果でも文脈が分かるようにします。deepinfraモデルガイドは、チームがワークフローに適したモデルの選択肢を比較するのに役立ちます。
検索の基礎
Deepinfra埋め込みはテキストをベクトルに変換し、表現が異なっていても関連する文章を検索システムが見つけられるようにします。まずは内容が明確で、それだけで意味が通じるテキストを用意し、検索結果が実際の質問に答えられるかを検証しましょう。
埋め込みを使って意味に基づいてテキストを検索し、回答を信頼する前に元の文章を確認しましょう。適切な準備は、読者が何を見つける必要があるかによって異なります。
読者は製品ガイドの用語を使わずに問題を説明します。
短いセクションを見出しとともに埋め込み、検索結果でも文脈が分かるようにします。deepinfraモデルガイドは、チームがワークフローに適したモデルの選択肢を比較するのに役立ちます。
担当者は顧客の質問に答えるポリシーの該当箇所を必要としています。
ポリシーを個別の文章に分けてインデックスに登録し、参照元の情報とともに返します。deepinfraコーディングプランガイドでは、サポート情報の検索ではなく、コーディング中心の作業に向けた別の方法を紹介しています。
異なる語彙を使った複数のレポートに、関連する調査結果が見つかります。
埋め込みを行った抜粋を検索し、結論を出す前にレポートの前後の文脈を読みましょう。deepinfraモデルガイドは、対象の文書群に適したモデルを検討するための出発点になります。
検索ワークフローには、役立つ文章を作ること、一貫した方法で表現すること、返された結果を評価することという、3つの異なる作業があります。
繰り返し表示されるナビゲーションを削除し、意味の区切りに沿って文書を分割します。個々の検索結果だけでも意味が通じるよう、各文章にタイトルやセクション名を残します。
保存する文章と入力されるクエリには、同じ埋め込みモデルを使用します。各インデックスで使用したモデルを記録してください。モデルを切り替える場合は、保存済みテキストの埋め込みを作り直す必要があります。
検索インデックスでクエリのベクトルと文章のベクトルを比較し、最も近い結果を確認します。正しい出典の文章があらかじめ分かっている質問でもテストしてください。
ベクトルが近い文章は出典の候補であり、その内容が正しい、または最新である証拠ではありません。
埋め込みによって、現在適用される方針よりも、もっともらしい古い文章が上位に表示されることがあります。埋め込みだけでは事実を確証できず、矛盾する出典のどちらが正しいかも判断できません。
代わりにすべきこと
文章とともに日付と出典の識別子を保存し、必要に応じて絞り込み、元の文書を確認します。
文書全体を1つの項目として埋め込むと、読者が必要とする特定の段落が埋もれてしまうことがあります。一方、細かく分割しすぎると、文の意味を理解するために必要な文脈が失われます。
代わりにすべきこと
代表的な質問を使って文章の分割サイズをテストし、近くにある見出しを残します。
異なる埋め込みモデルで作成したベクトルは、次元数が異なったり、意味の表し方が異なったりする場合があります。混在させると比較ができなくなるか、順位付けの信頼性が損なわれる可能性があります。
代わりにすべきこと
インデックスごとに使用モデルを記録し、モデルを変更する際はそのインデックスを再構築します。
埋め込みによって、元のテキストに含まれる氏名、機密情報、個人情報が匿名化されるわけではありません。
代わりにすべきこと
処理の対象にすべきでない情報を削除またはマスキングし、まず適用されるデータ取り扱い要件を確認します。
同じ埋め込み処理でも、対象とする読者はさまざまです。ただし、検索対象とする単位や有用なメタデータは、情報源によって異なります。
ヘルプ記事
サポート記事には、互いに関連のない複数の回答が含まれることがあります。記事のタイトルと参照元を残しつつ、質問やポリシーごとに記述を索引化してください。そうすることで、見つかった抜粋をエージェントが確認しやすくなります。
技術ドキュメント
コードのシンボル、エラーメッセージ、バージョンラベルは、意味的な類似性と同じくらい重要な場合があります。記述には識別子を正確に残し、それらの識別子が質問の鍵となる場合は、ベクトル検索とキーワード照合の併用を検討してください。
研究ノート
短い調査結果でも、研究名、日付、著者がなければ誤解を招くことがあります。埋め込み対象の各抜粋に出典や文書の参照情報を付け、見つかった有望な箇所の周辺にある根拠も読めるようにしてください。
検索の有用な出力は、類似度の順位だけではありません。人が場所を特定し、読み、評価できる記述です。
ステップ 1
「これは30日後に適用される」のような断片は、検索クエリに一致しても、「これ」が何を指すか分からない場合があります。埋め込みを作成する前に、主題を特定できるだけの前後の文脈を含めてください。元の文書から切り離した状態で各文章を確認し、見出しや文の追加が必要な断片を見つけてください。
ステップ2
実際の質問を少数用意し、それぞれにどの出典の文章が答えるべきかを記録します。検索後、想定した文章が結果に含まれるか、ほかの結果が読者に誤解を与える可能性がないかを確認します。元の資料や埋め込みモデルが変わったときは、この確認を繰り返してください。
代表的な文書をいくつか選び、それぞれを単独で意味が通じる文章に分け、各文章が検索されるはずの質問を作成します。これにより、インデックスを拡張する前に、埋め込みが役立つかを実際に判断できます。
テキストを、検索システムが比較できるベクトルとして表現します。一般的な用途には、意味検索や、別の回答生成ステップに文脈として渡す関連文章の検索があります。埋め込み自体は文章による回答ではありません。
検索したいテキストの言語や種類に対応するモデルを確認し、自分の質問と文書を使って候補をテストしてください。モデル名だけで選ぶのではなく、正しい文章が検索結果に現れるかを比較します。クエリとインデックス内の文章には、同じモデルを一貫して使用してください。
文書全体を1つのベクトルにすると範囲が広すぎて、特定の答えを確実に検索できない場合があります。文書を内容のまとまった文章に分割し、見出しと出典への参照を残してください。特定のセクションを指す質問を使って、分割位置を変えながらテストしてください。
いいえ。埋め込みモデルはベクトルを生成し、検索インデックスはクエリを受け取ったときにそれらを保存・比較します。ワークフローには、各検索結果を元の文章とソースに紐付ける方法も必要です。
新しいモデルのベクトルが、すでに保存されているベクトルと比較可能だと考えないでください。元の文章を再度埋め込み、影響を受けるインデックスを再構築してから、検索結果を再評価してください。結果が混在しないよう、各インデックスの生成に使用したモデルを記録してください。