Loading
Agentforce y IA generativa de Einstein
Consideraciones y limitaciones para la conversión de voz en texto en Agentforce

Consideraciones y limitaciones para la conversión de voz en texto en Agentforce

Antes de utilizar la acción Voz en texto, revise las consideraciones y limitaciones.

Ver ediciones admitidas.  
Marca de verificación verde

Este artículo se aplica a:

Agentforce Employee Agent, Agentforce Builder, Flow, API de REST, Apex
Marca cruzada roja

Este artículo no se aplica a:

Chat heredado, Canales de mensajería estándar

Consideraciones generales

  • La acción de agente Voz en texto no es compatible en Government Cloud.
  • La acción Voz en texto convierte archivos de audio compatibles en texto y devuelve la transcripción como resultado.
  • La acción Voz en texto se puede agregar a cualquier subagente y cualquier agente.
  • Esta acción se expone a través de la API de acciones invocables y está disponible a través de acciones de agentes, REST, Flow y Apex.
  • La acción Voz en texto procesa el audio de forma diferente dependiendo del modelo de transcripción seleccionado. Whisper V3 Turbo está alojado internamente por Salesforce en la región de su organización, lo que puede ser relevante para el cumplimiento, y ElevenLabs Scribe V2 utiliza una API pública externa.
  • Es posible que el audio en idiomas no compatibles o mixtos no se reconozca completamente.
  • Esta acción se puede utilizar en escenarios de flujo y automatización.
  • Esta acción está sujeta a límites de invocación basándose en la memoria disponible en su organización. Las solicitudes que superan el límite podrían fallar.
  • El tiempo de procesamiento puede variar en base a la longitud del audio, el tamaño del archivo, la calidad del audio y la complejidad del contenido, así como el modelo de transcripción seleccionado. Whisper V3 Turbo es generalmente más rápido, mientras que ElevenLabs Scribe V2 puede tener tiempos de procesamiento menos predecibles.
  • La gestión de errores se puede gestionar utilizando rutas de fallo de flujo.
  • No se admiten archivos de más de 5 MB.
  • No se admite la traducción.
  • No se admite la captura de micrófono en tiempo real.
  • La identificación del hablante, las marcas de tiempo y los puntuajes de confianza no están disponibles.
  • Cuando agregue la acción Hablar en texto a un subagente, asegúrese de que las instrucciones del subagente solicitan un Id. de archivo de audio válido o un nombre de archivo. Si se proporciona un nombre de archivo, el subagente debe incluir la acción Consultar registros para resolver el nombre de archivo en un Id. de archivo de audio antes de invocar la acción Habla en texto.

Límites de archivos y formatos de audio admitidos

Elemento Valor admitido
Formatos de archivo MP3, WAV, FLAC, OGG, OGA, AMR, MPEG, MPGA
Tamaño máximo de archivo 5 MB
Tipo de entrada Id. de archivo de audio
Resultado Texto convertido

Compatibilidad de idiomas

  • La acción Habla en texto detecta automáticamente el idioma del audio.
  • La detección de idioma del audio es automática y no se puede configurar.
  • El audio de idioma mixto o de idioma no admitido puede funcionar, pero la precisión de la transcripción puede variar.
  • La calidad de la transcripción puede variar dependiendo del idioma detectado. Si tiene intención de utilizar la transcripción en funciones descendentes de Agentforce, verifique que el idioma detectado es compatible. Consulte Idiomas admitidos de IA generativa.
  • Esta acción solo transcribe audio a texto y no realiza la traducción. Si la transcripción se utilizará en pláticas o acciones Agentforce, verifique que el idioma de la transcripción es compatible. Consulte Idiomas admitidos de IA generativa.

Tipos de uso para voz en texto

Tarjeta de Digital Wallet tipo de uso Descripción notas
Flexar créditos Voz a texto Voz en texto convierte la entrada de audio en texto utilizando modelos de reconocimiento automático de voz (ASR). El uso de crédito flexible se mide basándose en la duración del audio procesado, medida en segundos. Consulte Tipos de uso facturables Flex Credits

Tratamiento de errores

Si la acción Habla en texto no puede procesar una solicitud, devuelve un código de error y un mensaje.

Código de error Descripción Acción recomendada
MODELO_TRANSCRIPCIÓN_INVALID No se admite el modelo de transcripción. Ingrese o seleccione un modelo compatible e inténtelo de nuevo.
REQUIRED_FIELD_MISSING Falta un parámetro obligatorio. Especifique un valor para el parámetro requerido e inténtelo de nuevo.
INVALID_INPUT La solicitud contiene una entrada no válida. Verifique que los valores de entrada, incluyendo el Id. y el formato del archivo de audio, son válidos e inténtelo de nuevo.
LIMIT_EXCEEDED El archivo de audio supera el tamaño compatible o se superó el límite de solicitudes. Utilice un archivo de audio más pequeño o reintente la solicitud más adelante.
RECORD_NOT_FOUND No se encontró ningún archivo de audio para el Id. de ContentDocument proporcionado. Verifique que el Id. de ContentDocument es correcto y accesible.
INSUFFICIENT_ACCESS_OR_READONLY El acceso a la función o al archivo de audio no está disponible. Haga contacto con su administrador de Salesforce para obtener el acceso requerido.
UNKNOWN_EXCEPTION El archivo de audio no se pudo transcribir o se produjo un error inesperado. Vuelva a intentar la acción. Si el problema persiste, haga contacto con su administrador de Salesforce.
INVALID_INPUT_FORMAT No se admite el formato de archivo de audio. Utilice un formato de audio compatible como MP3, WAV, FLAC, OGG, OGA, AMR, MPEG o MPGA.

Utilice estos errores para configurar la gestión de fallos en Flujo o la gestión de errores en Apex.

 
Cargando
Salesforce Help | Article