Olet tässä:
Strategiat pilkkominen
Data 360 tukee useita pilkkomisstrategioita. Data 360 valitsee automaattisesti optimaalisen pilkkomistrategian työstämäsi sisältötyypin perusteella.
Mieti esimerkiksi kenttiä, jotka tarjoavat relevanttimman asiayhteyden ja semanttisen merkityksen, miten ne pilkotaan ja miten odotat noudettuja tuloksia käytettäviksi Einstein Gen AI-, automatisointi- ja analyysisovelluksessasi. Voit esimerkiksi pilkkoa Knowledge datamalliobjektin mukautetut tekstikentät käyttämällä Kulkujen nouto -strategiaa, jotta voit palauttaa helpommin semanttisesti samankaltaisia tuloksia, kun haet Knowledge.
- Osioiden tietoinen pilkkominen
- Semanttisesti perustuva myyntiputken nouto
- Keskusteluun perustuva pilkkominen
- Valmista kenttien pilkkominen
- Koodin laajennus
Osion tietoisuuden pilkkominen
Osioihin perustuva pilkkominen käyttää otsikko- ja otsikko-elementtejä asiakirjojen pilkkomiseen. Kaikki osion otsikon tai otsikkoelementin alla oleva teksti pilkotaan yhteen, kunnes Data 360 kohtaa uuden osion otsikon tai otsikkoelementin. Näin voit pilkkoa sisällön yhdenmukaisiin osioihin asiakirjan rakenteen perusteella.
Osioita ei jaeta koskaan mielivaltaisesti — lohkot noudattavat aina luonnollisen sisällön rajoja, säilyttämällä luettavuuden ja kontekstin. Joskus lyhyitä kappaleita tai luettelokohteita tunnistetaan väärin erillisinä osioina, mikä voi johtaa liian pieniin osioihin. Välty tältä, kun luot hakuindeksi, käytä näitä asetuksia.
- Enimmäisvaltuus: Yhdistä viereisiä pieniä osioita suuremmaksi osaksi optimoidaksesi osan koon uhkaamatta yhdenmukaisuutta. Lisätietoja on kohdassa Miten valtuuksien enimmäisasetus vaikuttaa pilkkomiseen.
- Päällekkäiset valtuudet: Käytetään vain, kun yhdestä osiosta luodaan useita osioita. Määritä kunkin osion lopusta seuraavan osion alkuun lisättävien valtuuksien määrä. Tämä luo asiayhteydestä johtuvia päällekkäisyyksiä peräkkäisten lohkojen välillä, mikä varmistaa saumattomat siirtymät ja parannetun suorituskyvyn tehtävissä, kuten haussa ja haussa.
Voit ryhmittää useita kappaleita yhdeksi osaksi, jos yhdistetty sisältö pysyy määritetyn valtuusrajoituksen sisällä.
Kun valtuuksien rajoitus saavutetaan, pilkkomislogiikka varmistaa selkeät tauot — se ei jaa lauseen tai kappaleen keskellä. Sen sijaan se laajenee kappaleen loppuun, mikä ylläpitää semanttista ja rakenteellista yhtenäisyyttä eri osioissa.
Esimerkiksi tämä teksti on jaettu osioihin sen otsikon ja seuraavien osioiden otsikoiden perusteella.
Tuloksena olevan pilkkomuotoisen datamalliobjektin esimerkkitoiminto sisältää nämä tietueet.
| Sekvenssin numero | Piste | Chunk DaTAsource Object | Datalähde |
|---|---|---|---|
| 1 | Retrievers A retriever returns relevant data from the vector database
to augment a prompt. By augmenting prompts with accurate, current, and pertinent
information, retrievers improve the value and relevance of LLM responses for
users. . . |
DataSourceObject__c |
DataSource__c |
| 2 | Default and Custom Retrievers When a search index is created in Data
Cloud, a default retriever is created automatically. You can't customize a default
retriever. However, in AI Models, you can create and customize retrievers for
search indexes. |
DataSourceObject__c |
DataSource__c |
| 3 | Dynamic Retrievers Some standard templates contain dynamic retrievers.
A dynamic retriever is a placeholder for a retriever specified at runtime
depending on the needs of the prompt template. To test a dynamic retriever, enter
the retriever’s API name, which you can find in AI Models. |
DataSourceObject__c |
DataSource__c |
Kun luot hakuindeksi Data 360:n kehittyneessä rakentajassa, osioihin perustuva pilkkominen on oletusarvoinen strategiasi HTML- ja PDF-tiedostoille.
Semanttisesti perustuva kulun nouto
Semanttisesti perustuva välilyönti käyttää HTML-tunnisteiden semanttista merkitystä jakaakseen asiakirjan välilyönteihin. Näitä HTML-elementtejä pidetään lohkojen loogisina rajoina.
- Otsikkotaso 1–6
<h1-h6> - Teema-aikojen
<hr> - Lihavoitu
<b>– Käytetään, kun merkitty teksti on omalla rivillään tai jos sitä käytetään tekstissä kappaleessa, jossafont_weighton vähintään 700 taifont_weightonbold. - Vahva
<strong>— Käytetään, kun merkitty teksti on omalla rivillään tai jos sitä käytetään tekstissä kappaleessa, jossafont_weighton vähintään 700 taifont_weighton lihavoitu - Kohta
<p>— Käytetään, kun merkitty teksti on omalla rivillään - Rivinvaihdon
<br>— Käytetään, kun tämänhetkinen osuus ylittää valtuuksien rajoituksen
Esimerkiksi tämä teksti sisältää useita HTML-elementtejä.
Alla on sen vastaava HTML-koodi
<h1>Enable Custom Time Zones</h1>
<p>Time zone support lets you view time-specific data...</p>
<h4>REQUIRED EDITIONS</h4>
<p>Available in Salesforce Classic and Lightning Experience</p>
<p>...</p>
<h2>Enable Time Zone Support</h2>
<ul>...</ul>Tuloksena olevan pilkkomuotoisen datamalliobjektin esimerkkitoiminto sisältää nämä tietueet.
| ChunkSequenceNumber | Piste | Datalähdeobjekti | Datalähde |
|---|---|---|---|
1 |
Enable Custom Time Zones Time zone support lets you view time-specific
data.... |
DataSourceObject__c |
DataSource__c |
2 |
REQUIRED EDITIONS Available in Salesforce Classic... |
DataSourceObject__c |
DataSource__c |
3 |
Enable Time Zone Support From Setup, enter
Analytics... |
DataSourceObject__c |
DataSource__c |
4 |
Sync Connected Objects and Refresh Datasets Run a full Data Sync of
your connected objects... |
DataSourceObject__c |
DataSource__c |
Jos kahden otsikkotunnisteen välillä ei ole sisältöä, kyseiset tunnisteet ja seuraava sisältö näytetään yhdessä erässä kahden sijaan. Data 360 yhdistää niin monta otsikkotunnistetta kuin se mahtuu yhteen osioon, jos otsikoiden välillä ei ole sisältöä.
Data 360 käyttää oletusarvoisesti ensin semanttiin perustuvaa menetelmää, mutta jos jotkin tuloksena saadut välilyönnit ovat liian pitkiä, ne käsitellään edelleen käyttämällä ikkunaan perustuvaa välilyöntien noutoa. Ikkunaan perustuva nouto käyttää lohkotason elementtejä, kuten <div>- ja <p>-tunnisteita tai rivinvaihdon <br> mukaan erotettua raakatekstiä, pilkoakseen asiakirjoja osioihin. Jos kappale ei sisällä HTML-koodia, aggregointi suoritetaan lauseen tasolla.
Keskusteluun perustuva pilkkominen
Keskusteluihin perustuva pilkkominen segmentoi audio- ja videotiedostoista käännettyä dataa lohkoihin, jotka tavallisesti erotetaan, kun ääni muuttuu.
Jos keskustelulokin aikana on useita puhujia, jokainen osio edustaa yksittäisen puhujan puhetta.
Alla on keskustelulokin ensimmäiset rivit.
"Hello? Hi Alex, it's Sam from Bullseye. I didn't hear from you yesterday, so I wanted to check in. Hi Sam, sorry about that."Tuloksena olevan pilkkujen datamalliobjektin osio sisältää nämä tietueet.
| ChunkSequenceNumber | Piste | Aloita aikaleima | Päättymisajan aikaleima | Kaiutin |
|---|---|---|---|---|
1
|
Hello?
|
1.051
|
1.253
|
SPEAKER_00
|
2
|
Hi Alex, it 's Sam from Bullseye. I didn't hear from you yesterday, so I
wanted to check in.
|
3.203
|
8.418
|
SPEAKER_01
|
3
|
Hi Sam, sorry about that.
|
10.263
|
11.546
|
SPEAKER_00
|
Valmistaudu kenttien pilkkomiseen
Kun sinun täytyy lisätä lisää metadataa tarjotaksesi asiayhteydet DMO-organisaatioista tai UDMO-organisaatioista luoduille lohkoille, aseta kentät lohkoihin. Esimerkiksi Knowledge-artikkelin Description-kenttä saattaa ylittää optimaalisen osakkeen koon kehotteisiin perustuvaa noutamista varten. Voit tarjota enemmän kontekstia kehotteen tuloksissa lisäämällä Title-kentän osiin.
Tämä taulukko tarjoaa joitakin hyödyllisiä metadatakenttiä.
| Tyyppi | Esimerkkejä metadata-kentistä |
|---|---|
| DMO (Knowledge) |
|
| UDMO (ulkoiset blob-myymälän liittimet) | Tiedostopolku |
| UDMO (Webcrawler- tai Sitemap-liittimet) |
|
Määritä kentät, jotka valmistautuvat DMO- tai UDMO-organisaatioiden osioihin vektori- tai hybridihakuhaun hakuindeksin lisämäärityksissä.
Osan valtuuksien enimmäisrajoitus on 512, joten varmista, että kaikissa kentissä, jotka valitset etukäteen, arvot ovat kyseisen rajoituksen sisällä. Data 360 ohittaa edeltävät kentät, jos niiden pituus on yli 512 valtuutta.
Koodilaajennus
Käytä mukautettua pilkkomustoimintoa, kun sisäänrakennetut strategiat eivät täytä sisältö- tai noutovaatimuksiasi. Mukautetut funktiot ovat hyödyllisiä, kun osioiden rajat täytyy noudattaa toimialuekohtaista logiikkaa, esimerkiksi säilyttääksesi siihen liittyviä osioita monimutkaisista PDF-tiedostoista tai käyttääksesi kehotteisiin perustuvaa pilkkomista LLM-yhdyskäytävän kutsujen kautta.
Käytä koodilaajennusta ottaaksesi mukautetun toiminnon käyttöön ja valitaksesi sen hakuindeksi Lisämääritykset. Lisätietoja mukautetun pilkkomistoiminnon kirjoittamiseen, vahvistamiseen, käyttöönottoon ja käyttämiseen käytetystä kokonaisvaltaisesta työnkulusta on kohdassa Mukautettujen funktioiden käyttäminen Data 360:ssa.
