breadcrumbDescription
Parsing og forhåndsbehandling af indhold
Forbered ustrukturerede data til segmentering ved brug af Data 360-indholdsparsing og forbehandling. Parsing og forbehandling identificerer dokumentstrukturer, f.eks. overskrifter, afsnit eller tabeller, fjerner irrelevant indhold og forbereder teksten til segmentering og indeksering.
- LLM-baseret parsing og forhåndsbehandling
Brug LLM-baseret parsing og forbehandling til at udtrække og forberede tekst, metadata, tabeller og billeder fra ustrukturerede dokumenter til segmentering. - Docling-parser
Docling-parseren er en intelligent dokumentparsningsstruktur fra tredjepart, der samler flere open source-modeller til layoutforståelse og tabeludtrækning. Hvis du vil forbedre svar fra oplysninger, der er tilgængelige i billeder og komplekse tabeller, skal du kombinere Docling-parser med billedbehandling ved brug af store sprogmodeller (LLM'er).
