Loading
About Salesforce Data 360
Hakuindeksien optimointi: Kenttien valinta ja pilkkominen

Hakuindeksien optimointi: Kenttien valinta ja pilkkominen

Kun luot hakuindeksi kehittyneessä rakentajassa, voit optimoida hakuindeksi tarjotaksesi tarkempia tuloksia kiinnittämällä huomiota käyttämääsi kenttien valintaan ja pilkkomisstrategioihin.

Tekstikenttien indeksointi

Jos haluat lisätä tekstikenttiä luodessasi hakuindeksi, valitse tekstikentät, joilla on pidempi, vapaan tekstin sisältö. Voit indeksoida useita tekstikenttiä jopa DMO-organisaatiosta. Jos valitset esimerkiksi DMO-organisaatiosta kentät Description, Summary, Content ja Resolution, Data 360 tallentaa kaikki vastaavat vektorit samaan hakuindeksiin.

Voit erottaa vektorit indeksin DMO-organisaation DataSource__c-kentän perusteella. DataSource__c-kenttä sisältää kentän alkuperäisen nimen. Koska tämä kenttä on indeksin DMO-organisaatiossa, voit käyttää sitä noutajan etusuodattimessa. Voit esimerkiksi määrittää noutajan arvioimaan kyselyitä, jotka vastaavat semanttisesti vain tiettyä kenttää, kuten Description, eivätkä Resolution.

Vältä valitsemasta liian monta samanlaista kenttää tai tarpeettomia kenttiä (esimerkiksi Summary, Title ja Description). Tämä saattaa heikentää palautusta, jos noutojasi ei sisällä etusuodattimia DataSource__c:ssä. Koska nämä kentät sisältävät todennäköisesti samat tai hyvin samankaltaiset tiedot, samasta asiakirjasta voi näkyä kyselyn tuloksissa vähintään kolme lohkoa (yksi lohkoa kullekin kentälle). Nämä tuovat samat tiedot LLM-ohjelmaan, ja jos määrität noudontarjoajan noutamaan esimerkiksi yhdeksän tulosta, tuloksissa näytetään vain kolme asiakirjaa. Tämä vähentää hakutulosten variaatiota ja saattaa aiheuttaa asiakirjojen puuttumisen.

Suosittelemme, että kun kaksi tai useampaa kenttää edustavat samaa sisältöä, mutta eri muodossa, valitse kenttä, jolla on pisin teksti, kuten Description. Harkitse kentän alkua lyhyemmällä ja tiiviimmällä versiolla, kuten Title.

Vihje
Vihje Älä valitse kategorisia sarakkeita indeksikenttinä. Kategorinen data on yhden tai kahden sanan kuvaajia, jotka kartoitetaan valintaluetteloon Salesforcessa. Semanttinen haku vaatii pidemmän tekstialueen ja enemmän kontekstia luodakseen hyödyllisiä tuloksia.

Valmistele-kenttien käyttäminen

Eräs tapa optimoida pienennestrategiaasi on käyttää esikatselukenttiä lisätäksesi lohkoihin tietoja ja tehdäksesi niiden tunnistamisesta helpompaa. Oletetaan esimerkiksi, että sinulla on osio, joka sisältää vianmääritysvaiheiden sarjan. Kun lisäät tämän osan ennen Title-kenttää, joka sisältää tekstin ”Kuinka korjata laite X, kun se näyttää käyttäjän toimintatavan Y”, voit tunnistaa sisällön helpommin käyttäjän kysymykseen liittyen. Esikatselevat kentät, kuten Title tai Product Name, lisäävät nämä arvot lohkoon, mikä tekee niistä näkyviä kehotteiden augmentoinnissa tai Data 360 -kyselyeditorissa.

Osan koon säätäminen

Toinen tapa optimoida pilkkomista on säätää lohkon kokoa.

Kun luot oletusarvoisen hakuindeksi, Data 360 käyttää semanttiin perustuvia merkintöjä sisällön pilkkomiseksi mahdollisimman pieniksi paloiksi. Data Cloud sitten kerää lohkot takaisin yhteen, kunnes se saavuttaa määrittämäsi lohkokoko tai oletusarvoisen enimmäiskokoon (512 valtuutta).

Saatat huomata, että tämä vaatii jonkin verran kokeilua, koska osan optimaalinen koko ja strategia vaihtelevat RAG- tai agenttien toteutuksen mukaan.

Lisätietoja on kohdassa Miten enimmäisvaltuuden asetus vaikuttaa pilkkomiseen.

Osuuksien optimointi noutamista varten

Kun suunnittelet noudettavien lohkojen kokoa, ota huomioon pilkkomasi sisällön tiheys ja organisaatiorakenne. Muista, että yksi osio palauttaa yhden vektorin. Koko osan sisältö esitetään tässä yksittäisessä vektorissa. Mieti, kuinka monta sanaa tarvitaan ymmärtääksesi osan merkityksen oikein. Toimiiko 400–500 sanaa? Tai voivatko vähemmän sanoja kerätä riittävästi itseään sisältävää tietoja (mahdollisesti parannettua kenttien edellä tai osioiden rikastuksella)? Nämä ovat kysymyksiä, jotka tulisi esittää suunnittelussa.

Pisteiden optimointi kehotteiden augmentointia varten

Sinun tulisi myös harkita pilkkomista kehotteen augmentoinnin näkökulmasta. Kuinka monta lohkoa LLM tarvitsee luodakseen riittävän hyödyllisen vastauksen? Onko pieni, yksittäinen factoid tarpeeksi hyödyllinen vai vaativatko LLM-ohjelmasi enemmän kontekstia?

Jos käytät UDMO-pohjaisia hakuindeksejä, sisällön augmentointi riippuu tavallisesti osan koosta, jolloin osan täytyy olla suurempi lisätäkseen asiayhteyden.

DMO-pohjaisille indekseille on enemmän vaihtoehtoja, koska voit käyttää lisäkenttiä aggregointia varten. Kehotetta voi jopa yhdistää käyttämällä alkuperäistä asiakirjaa (esimerkiksi Knowledge) yhden osan sijaan. Tämä parantaa kehotteen ratkaisua, joten ota huomioon LLM:n konteksti-ikkuna suhteessa valittuun tulosten määrään. Pidä kuitenkin mielessäsi, että nämä kehotteet kasvattavat vastausten luonnin kustannuksia: Toisin sanoen, jos kasvatat kehotteen ja vastauksen kokoa, kulutat enemmän Einstein.

 
Ladataan
Salesforce Help | Article