Du är här:
Hur inställningen Max token påverkar uppdelning
När du anger strategin för uppdelning i ett sökindex konfiguration anger du den högsta tokengränsen för att styra hur mycket text som inkluderas i en del. I Data 360 är den maximala tokengränsen satt till 512 som standard.
Inbäddade modeller skapar tokens från text och de ignorerar all text utöver sin maxgräns för tokens. Begreppet "token" skiljer sig dock åt beroende på språk och inbäddningsmodell, så det är inte tillförlitligt att räkna delar direkt från text.
När du skapar ett sökindex fungerar tokenskapande enligt följande: Data 360 separerar meningar i ditt innehåll och kopplar sedan meningarna till delar baserat på din specificerade maxtokeninställning. Slutligen konverterar inbäddningsalgoritmen varje del till en vektor.
För att uppskatta tokenantalet vid koppling av meningar till delar använder Data 360 antalet ord för latinbaserade språk och antalet skiljetecken för icke-latinbaserade språk (som japanska). I latinbaserade språk är ett ord ungefär en token, men i icke-latinbaserade språk är förhållandet mellan tecken och tokens inte lika tydligt. Med detta i åtanke är en latinbaserad språkdel på 512 ord vanligtvis inom gränsen på 512 token. För icke-latinbaserade språk kan dock 512 skiljetecken överskrida 512 tokens på grund av hur inbäddningsalgoritmen fungerar. I sådana fall inkluderas inte all text som inkluderas i inbäddningen, vilket kan påverka relevansen för dina sökresultat. För denna typ av innehåll, använd en maxgräns för token som är lägre än 512.
