Loading
Agentforce et IA générative Einstein
Détection de la toxicité

Détection de la toxicité

La couche de confiance Einstein utilise des modèles d'apprentissage automatique (ML) pour identifier et marquer les contenus toxiques dans les invites et les réponses.

Éditions requises

Disponible avec : les éditions Enterprise, Performance et Unlimited avec un complément Einstein pour Sales, Einstein pour Platform, Einstein pour Service, Einstein 1 Service ou Einstein GPT Service. Pour acheter des compléments, contactez votre chargé de compte Salesforce.

Les sorties de vos applications d'IA destinées aux clients représentent la marque et le ton de votre entreprise. L'IA est parfois susceptible de générer du contenu toxique ou nuisible qui peut entraîner des conséquences sur la réputation de votre entreprise. La toxicité dans les réponses peut également être influencée par les invites. Par conséquent, il est important de détecter la toxicité non seulement dans les réponses mais aussi dans les invites. La toxicité dans les invites peut provenir de sources non fiables telles que des interactions de chat public et du contenu Web tiers.

Remarque
Remarque La détection de la toxicité dans les réponses est activée par défaut et l'option ne peut pas être modifiée. La détection de la toxicité dans les invites (bêta) est désactivée par défaut, mais vous pouvez l'activer pour votre organisation Salesforce.

En cas de toxicité détectée dans des invites ou des réponses, une notification ou un avertissement est affiché dans les fonctionnalités d'IA de Salesforce à l'exécution. Par exemple, des avertissements de toxicité sont affichés dans Copilot ou le Générateur de répliques si un contenu toxique est détecté dans la réponse générée par le LLM.

Remarque
Remarque Avertissement : l'avertissement de toxicité n'est pas disponible pour toutes les fonctionnalités de l'IA.

Avertissement de toxicité dans le Générateur de répliques

L'image affiche un message d'avertissement pour vous signaler que le contenu est toxique et potentiellement nocif
Important
Important Bien que nos modèles de détection de toxicité se soient révélés efficaces lors des tests internes, il est important de noter qu'aucun modèle ne peut garantir une précision à 100 %. En outre, les cas d'utilisation interrégions et multinationaux peuvent affecter la capacité de détecter des modèles de données spécifiques. La fiabilité étant notre priorité, nous sommes dédiés à l'évaluation et au perfectionnement continus de nos modèles.

Catégories de toxicité

Les modèles de détection de la toxicité Einstein reconnaissent les catégories suivantes:

Catégorie Type de contenu
Violence Contenu qui dépeint, référence ou incite à un comportement destiné à causer un préjudice physique aux personnes, aux animaux ou aux biens
Sexuel Contenu qui dépeint, référence ou sollicite du matériel, un comportement ou un langage en lien avec du langage, des images ou des thèmes sexuels, y compris du contenu sexuel consenti et non consenti, des actes et des comportements sexuels illégaux et légaux, et du contenu sexuellement suggestif et coquet
Vulgarité Contenu qui inclut des propos, des gestes et des discours incendiaires, injurieux, obscènes, vulgaires ou irrévérencieux
Haine Contenu qui dépeint, référence ou incite à un comportement ou à un langage visant à causer un préjudice psychologique à une personne ou à un groupe sur la base de son identité ou d'autres traits personnels distinctifs
Physique Contenu qui dépeint, référence, encourage ou permet l'utilisation, l'acquisition ou la distribution de substances illicites, de médicaments en vente libre et d'autres substances ayant un effet physiologique ou psychologique lorsqu'elles sont consommées ou un comportement destiné à causer un préjudice physique, un automutilation ou la mort

Score de toxicité

Chaque catégorie de contenu toxique est évaluée pour indiquer la probabilité de ce type de langage toxique dans le texte. De plus, la couche de confiance Einstein fournit un score de toxicité global qui reflète l'ensemble de toutes les catégories détectées.

Les scores varient de 0 à 1, 1 étant le plus toxique. Les scores sont consignés dans un journal d'audit et stockés dans Data 360. Les rapports et tableaux de bord prédéfinis Trust Layer visualisent les tendances de toxicité dans les fonctionnalités et dans le temps. Vous pouvez également créer des rapports personnalisés dans Data 360.

 
Chargement
Salesforce Help | Article