您在此处:
混合搜索自动删除最佳实践
使用这些最佳实践为 Data 360 混合搜索结果配置自动删除。
- 将这些推荐值用于自动删除,对于关键字搜索结果使用 2,对于向量搜索结果使用 5。测试这些配置,并根据用例和查询的需要调整它们。
- 对于关键字搜索结果,我们建议自动删除值为 2,对于向量搜索结果,我们建议自动删除值为 5。
{ "autodrop_keyword": {"num_drops": 2}, "autodrop_vector":{"num_drops": 5 }} - 对于关键字搜索结果,默认自动删除值不太积极。
{ "autodrop_keyword": {"num_drops": 5}, "autodrop_vector":{"num_drops": 5 }}
- 对于关键字搜索结果,我们建议自动删除值为 2,对于向量搜索结果,我们建议自动删除值为 5。
- 由于混合搜索结果分发自动删除的性质,可能会导致意外行为。我们建议您使用“autodrop_vector”和“autodrop_keyword”参数,而不是“autodrop_hybrid”参数。
select * from hybrid_search( table(<Search_index_DMO>), ‘<Search String>’, '<PreFilteringColumn><Operator><Value>', '<Limit Results>', ‘{ "autodrop_keyword": {"num_drops": 2}, "autodrop_vector":{"num_drops": 5 }}’ ); - 要确保搜索结果包含最相关的结果,请使用一组测试查询来校准自动删除的数量,并逐渐改变该值,直到结果集中出现相关结果。
要使混合搜索自动删除不那么积极并保留更多结果,请考虑增加 num_drops 值。过于激进的自动删除会截断重要文档,特别是如果数据集中的得分下降不明显,或者您对相关结果的定义更广泛。您可以根据您注意到相关结果丢失的位置调整“autodrop_keyword”、“autodrop_vector”或“autodrop_hybrid”。
要使混合搜索自动删除更具攻击性并保留最相关的结果,请降低 num_drops 的值。例如,如果在初始自动删除后搜索结果仍包含大量不相关的文档,并且默认 num_drops 无法有效过滤掉噪音,您应降低 num_drops 值。
- 如果自动删除的值超过列表中的实际得分删除数量,则不会应用截断。
- 如果文档包含多个相似术语,对关键字结果应用自动删除有助于仅保留最相关的结果。
- 或者,您可以通过设置查询返回结果数量的限制来减少结果集。有关更多详细信息,请查看使用查询 API 运行混合搜索查询。在此示例中,限制设置为查询的两个结果。
select * from hybrid_search( table(Knowledge_full_index__dlm), 'How to input special mark/character when using keyboard input data field','', 2)
select Chunk__c, hybrid_score__c, keyword_score__c, vector_score__c, chk.SourceRecordId__c
from hybrid_search(table(Indeed_English_index__dlm), 'Maximize', '', 100, '{ "dfr" : {} }') hsearch
join Indeed_English_chunk__dlm chk on hsearch.RecordId__c = chk.RecordId__c
ORDER BY hybrid_score__c DES通过为矢量搜索结果和关键字搜索结果配置自动拖放,搜索结果的范围缩小到最相关的结果。
select Chunk__c, hybrid_score__c, keyword_score__c, vector_score__c, chk.SourceRecordId__c
from hybrid_search(table(Indeed_English_index__dlm), 'Maximize', '', 100, '{ "autodrop_keyword": {"num_drops": 2}, "autodrop_vector":{"num_drops": 5 }}') hsearch
join Indeed_English_chunk__dlm chk on hsearch.RecordId__c = chk.RecordId__c
ORDER BY hybrid_score__c DESC