Vous êtes ici :
Détection de la toxicité
La couche de confiance Einstein utilise des modèles d'apprentissage automatique (ML) pour identifier et marquer les contenus toxiques dans les invites et les réponses.
Éditions requises
| Disponible avec : les éditions Enterprise, Performance et Unlimited avec un complément Einstein pour Sales, Einstein pour Platform, Einstein pour Service, Einstein 1 Service ou Einstein GPT Service. Pour acheter des compléments, contactez votre chargé de compte Salesforce. |
Les sorties de vos applications d'IA destinées aux clients représentent la marque et le ton de votre entreprise. L'IA est parfois susceptible de générer du contenu toxique ou nuisible qui peut entraîner des conséquences sur la réputation de votre entreprise. La toxicité dans les réponses peut également être influencée par les invites. Par conséquent, il est important de détecter la toxicité non seulement dans les réponses mais aussi dans les invites. La toxicité dans les invites peut provenir de sources non fiables telles que des interactions de chat public et du contenu Web tiers.
En cas de toxicité détectée dans des invites ou des réponses, une notification ou un avertissement est affiché dans les fonctionnalités d'IA de Salesforce à l'exécution. Par exemple, des avertissements de toxicité sont affichés dans Copilot ou le Générateur de répliques si un contenu toxique est détecté dans la réponse générée par le LLM.
Avertissement de toxicité dans le Générateur de répliques
Catégories de toxicité
Les modèles de détection de la toxicité Einstein reconnaissent les catégories suivantes:
| Catégorie | Type de contenu |
|---|---|
| Violence | Contenu qui dépeint, référence ou incite à un comportement destiné à causer un préjudice physique aux personnes, aux animaux ou aux biens |
| Sexuel | Contenu qui dépeint, référence ou sollicite du matériel, un comportement ou un langage en lien avec du langage, des images ou des thèmes sexuels, y compris du contenu sexuel consenti et non consenti, des actes et des comportements sexuels illégaux et légaux, et du contenu sexuellement suggestif et coquet |
| Vulgarité | Contenu qui inclut des propos, des gestes et des discours incendiaires, injurieux, obscènes, vulgaires ou irrévérencieux |
| Haine | Contenu qui dépeint, référence ou incite à un comportement ou à un langage visant à causer un préjudice psychologique à une personne ou à un groupe sur la base de son identité ou d'autres traits personnels distinctifs |
| Physique | Contenu qui dépeint, référence, encourage ou permet l'utilisation, l'acquisition ou la distribution de substances illicites, de médicaments en vente libre et d'autres substances ayant un effet physiologique ou psychologique lorsqu'elles sont consommées ou un comportement destiné à causer un préjudice physique, un automutilation ou la mort |
Score de toxicité
Chaque catégorie de contenu toxique est évaluée pour indiquer la probabilité de ce type de langage toxique dans le texte. De plus, la couche de confiance Einstein fournit un score de toxicité global qui reflète l'ensemble de toutes les catégories détectées.
Les scores varient de 0 à 1, 1 étant le plus toxique. Les scores sont consignés dans un journal d'audit et stockés dans Data 360. Les rapports et tableaux de bord prédéfinis Trust Layer visualisent les tendances de toxicité dans les fonctionnalités et dans le temps. Vous pouvez également créer des rapports personnalisés dans Data 360.
