プロンプトテンプレートに適した AI モデルの選択
AI モデルを選択してテストし、特定の使用事例に最適なモデルを見つけます。適切なモデルの選択は、応答品質、コスト、パフォーマンスに大きく影響します。
必要なエディション
| 使用可能なインターフェース: Lightning Experience |
| 使用可能なエディション: Einstein for Platform、Einstein または Agentforce for Sales/Service アドオン、または Agentforce Foundation が付属する Enterprise Edition、Performance Edition、および Unlimited Edition |
プロンプトビルダーで、プロンプトテンプレートを強化する AI モデルを選択します。最新または最も強力なモデルが常に最適な選択であるとは限りません。重要なのは、実際のデータを使用して特定の ToDo でモデルがどの程度適切に実行されるかです。
モデル選択の原則
ToDo の特殊性が最も重要です。モデルが異なれば、得意とするタスクも異なります。クリエイティブなセールスメールの生成に有効なものは、ケースから構造化データを抽出するのには機能しない可能性があります。モデルは、一般的なベンチマークではなく、実際の使用事例で必ずテストしてください。
Performance over recency (最新よりもパフォーマンスが高い)。新しいモデルの方がニーズに応じて自動的に改善されるわけではありません。最新のモデルにデフォルト設定するのではなく、タスクのパフォーマンスを測定します。
コストと精度のトレードオフ。多くの場合、高価なモデルほど (常にではありませんが) 高品質の出力が生成されます。モデルコストを対応の表示とビジネスへの影響と照合します。
| シナリオ | 品質ニーズ | モデルの選択 |
|---|---|---|
| サポートチームによる内部ケース概要の参照 | 十分 | コスト効率に優れたモデル |
| エンタープライズアカウントの顧客向けメール | 非常に良い | プレミアムモデル |
| 数千件のレコードの一括項目生成 | 一貫性とスピード | 中間層モデル |
| 1 回限りのエグゼクティブサマリー | 最善を尽くす | プレミアムモデル |
本番環境では一貫性が極めて重要です。80% の確率で優れた応答、20% の確率で低い応答を生成するモデルは、本番で使用する準備ができていません。同じ入力を使用して各モデルを複数回テストし、ピークパフォーマンスだけでなく一貫性も測定します。
モデルのテストと選択
このプロセスに従って、証拠に基づくモデルを選択します。
ステップ 1: 成功条件を定義します。モデルをテストする前に、使用事例にとって「良い」とはどういう意味かを決定します。2 ~ 3 個の測定可能な条件を特定します。たとえば、セールスメールプロンプトの場合、パーソナライズ (メールは特定の取引先の詳細を参照)、口調 (専門的だが会話的で、スコアは 1 ~ 5 です)、長さ (100 ~ 150 語) です。
ステップ 2: テストデータを作成します。実際の利用状況から代表的な例を 10 ~ 20 個用意します。作成済みのテストデータではなく、実際の Salesforce レコードを使用します。実際のデータでは、空の項目、異常な値、非常に長いまたは短いテキスト、特殊文字などのエッジケースが表示されます。業種、ケース種別、取引先規模ごとにさまざまなものを含め、典型的なレコードと問題のあるレコードの両方を含めます。
ステップ 3: 各モデルをテストします。テストデータを使用して、使用可能な各モデルに対してプロンプトテンプレートを実行します。すべてのモデルでまったく同じプロンプトテンプレートとテストデータを使用します。モデルの選択内容を変更するだけです。
ステップ 4: 結果を測定する。各出力を成功条件に対してスコアリングします。すべてのテストレコードの合格率、平均スコア、遵守率などの集計統計を計算します。
ステップ 5: データを分析します。成功条件全体でモデルを比較します。使用事例で最も重要な条件に基づいて、どのモデルのパフォーマンスが最も高いかを特定します。
ステップ 6: 一貫性を確認する。上位 2 ~ 3 件のモデルの場合、5 件のテストレコードに対して同じプロンプトを 5 回実行します (モデルごとに合計 25 回実行)。分散が高いということは、本番ではモデルが信頼できないということです。分散の少ないモデルを選択します。
ステップ 7: 証拠に基づいて選択します。評価やマーケティング上の要求ではなく、実際の成功条件に基づいて最もパフォーマンスの高いモデルを選択します。選択した条件、テスト結果の概要、テスト日など、選択した内容を文書化します。新しいモデルが使用可能になったら、ベースラインに対して再テストして比較できます。
モデルを切り替えるタイミング
モデルの選択は永続的ではありません。次の状況では切り替えを検討してください。
- 新しいモデルが使用可能になります。Salesforce が新しいモデルをリリースしたら、同じプロセスを使用してベースラインに対してテストします。new equals better (新しい = より良い) と思い込まないでください。
- 使用事例が変更されます。要件が変更された場合 (複数言語のサポートや出力が長くなる場合など)、モデルを再テストします。
- パフォーマンスが低下する。出力品質の経時的な低下に気付いた場合は、代替モデルをテストします。モデルの更新が特定の使用事例のパフォーマンスに影響する場合があります。
- コストに関する考慮事項が変更されます。量が劇的に増加した場合、品質が若干低下しても、よりコスト効率の高いモデルが理にかなっている可能性があります。エンドユーザーにとって品質の違いが顕著かどうか、およびビジネスの結果に影響するかどうかを分析します。
よくあるモデル選択の間違い
- 一般的なベンチマークに基づいて選択します。ベンチマークでは、一般的な機能を測定します。特定の ToDo がベンチマーク ToDo と一致しない場合があります。必ず実際のプロンプトとデータを使用してテストしてください。
- 再テストなし。モデルが変更され、新しいモデルがリリースされ、使用事例が進化します。重要なプロンプトの四半期ごとのモデルレビューをスケジュールします。
- 人工データを使用したテスト。本番データが乱雑である。実際のレコードには、空の項目、エッジケース、予期しない値があります。必ず実際の Salesforce レコードを使用してテストしてください。
- 一度テストします。1 回のテストでは、整合性の問題は検出されません。同じ入力を使用して複数回テストし、一貫性を測定します。
- 誤った評価指標に対する最適化。最初に成功条件を定義してから、一般的な品質や創造性ではなく、その特定の条件でテストします。
モデル比較チェックリスト
モデルを比較する場合は、次の項目を評価します。
- 正確性: 出力は期待されるコンテンツおよび形式と一致しますか?
- 一貫性: 実行の繰り返しによって同様の品質が生成されるかどうか
- コンプライアンス: 応答は項目のサイズと形式の制約に適合していますか?
- トーン: お客様のブランドと使用事例に音声は一致していますか?
- 完全性: 必要な要素がすべて含まれているか?
- スピード: 応答時間はユーザーの期待を満たしていますか?
- コスト: 価格はこの使用事例のビジネス価値と一致していますか?
- エッジ ケース:異常または最小限のデータをどのように処理しますか?

