Usted está aquí:
Consideraciones y limitaciones para la conversión de voz en texto en Agentforce
Antes de utilizar la acción Voz en texto, revise las consideraciones y limitaciones.
| Ver ediciones admitidas. | |
![]() Este artículo se aplica a: |
Agentforce Employee Agent, Agentforce Builder, Flow, API de REST, Apex |
![]() Este artículo no se aplica a: |
Chat heredado, Canales de mensajería estándar |
Consideraciones generales
- La acción de agente Voz en texto no es compatible en Government Cloud.
- La acción Voz en texto convierte archivos de audio compatibles en texto y devuelve la transcripción como resultado.
- La acción Voz en texto se puede agregar a cualquier subagente y cualquier agente.
- Esta acción se expone a través de la API de acciones invocables y está disponible a través de acciones de agentes, REST, Flow y Apex.
- La acción Voz en texto procesa el audio de forma diferente dependiendo del modelo de transcripción seleccionado. Whisper V3 Turbo está alojado internamente por Salesforce en la región de su organización, lo que puede ser relevante para el cumplimiento, y ElevenLabs Scribe V2 utiliza una API pública externa.
- Es posible que el audio en idiomas no compatibles o mixtos no se reconozca completamente.
- Esta acción se puede utilizar en escenarios de flujo y automatización.
- Esta acción está sujeta a límites de invocación basándose en la memoria disponible en su organización. Las solicitudes que superan el límite podrían fallar.
- El tiempo de procesamiento puede variar en base a la longitud del audio, el tamaño del archivo, la calidad del audio y la complejidad del contenido, así como el modelo de transcripción seleccionado. Whisper V3 Turbo es generalmente más rápido, mientras que ElevenLabs Scribe V2 puede tener tiempos de procesamiento menos predecibles.
- La gestión de errores se puede gestionar utilizando rutas de fallo de flujo.
- No se admiten archivos de más de 5 MB.
- No se admite la traducción.
- No se admite la captura de micrófono en tiempo real.
- La identificación del hablante, las marcas de tiempo y los puntuajes de confianza no están disponibles.
- Cuando agregue la acción Hablar en texto a un subagente, asegúrese de que las instrucciones del subagente solicitan un Id. de archivo de audio válido o un nombre de archivo. Si se proporciona un nombre de archivo, el subagente debe incluir la acción Consultar registros para resolver el nombre de archivo en un Id. de archivo de audio antes de invocar la acción Habla en texto.
Límites de archivos y formatos de audio admitidos
| Elemento | Valor admitido |
| Formatos de archivo | MP3, WAV, FLAC, OGG, OGA, AMR, MPEG, MPGA |
| Tamaño máximo de archivo | 5 MB |
| Tipo de entrada | Id. de archivo de audio |
| Resultado | Texto convertido |
Compatibilidad de idiomas
- La acción Habla en texto detecta automáticamente el idioma del audio.
- La detección de idioma del audio es automática y no se puede configurar.
- El audio de idioma mixto o de idioma no admitido puede funcionar, pero la precisión de la transcripción puede variar.
- La calidad de la transcripción puede variar dependiendo del idioma detectado. Si tiene intención de utilizar la transcripción en funciones descendentes de Agentforce, verifique que el idioma detectado es compatible. Consulte Idiomas admitidos de IA generativa.
- Esta acción solo transcribe audio a texto y no realiza la traducción. Si la transcripción se utilizará en pláticas o acciones Agentforce, verifique que el idioma de la transcripción es compatible. Consulte Idiomas admitidos de IA generativa.
Tipos de uso para voz en texto
| Tarjeta de Digital Wallet | tipo de uso | Descripción | notas |
|---|---|---|---|
| Flexar créditos | Voz a texto | Voz en texto convierte la entrada de audio en texto utilizando modelos de reconocimiento automático de voz (ASR). El uso de crédito flexible se mide basándose en la duración del audio procesado, medida en segundos. | Consulte Tipos de uso facturables Flex Credits |
Tratamiento de errores
Si la acción Habla en texto no puede procesar una solicitud, devuelve un código de error y un mensaje.
| Código de error | Descripción | Acción recomendada |
|---|---|---|
| MODELO_TRANSCRIPCIÓN_INVALID | No se admite el modelo de transcripción. | Ingrese o seleccione un modelo compatible e inténtelo de nuevo. |
| REQUIRED_FIELD_MISSING | Falta un parámetro obligatorio. | Especifique un valor para el parámetro requerido e inténtelo de nuevo. |
| INVALID_INPUT | La solicitud contiene una entrada no válida. | Verifique que los valores de entrada, incluyendo el Id. y el formato del archivo de audio, son válidos e inténtelo de nuevo. |
| LIMIT_EXCEEDED | El archivo de audio supera el tamaño compatible o se superó el límite de solicitudes. | Utilice un archivo de audio más pequeño o reintente la solicitud más adelante. |
| RECORD_NOT_FOUND | No se encontró ningún archivo de audio para el Id. de ContentDocument proporcionado. | Verifique que el Id. de ContentDocument es correcto y accesible. |
| INSUFFICIENT_ACCESS_OR_READONLY | El acceso a la función o al archivo de audio no está disponible. | Haga contacto con su administrador de Salesforce para obtener el acceso requerido. |
| UNKNOWN_EXCEPTION | El archivo de audio no se pudo transcribir o se produjo un error inesperado. | Vuelva a intentar la acción. Si el problema persiste, haga contacto con su administrador de Salesforce. |
| INVALID_INPUT_FORMAT | No se admite el formato de archivo de audio. | Utilice un formato de audio compatible como MP3, WAV, FLAC, OGG, OGA, AMR, MPEG o MPGA. |
Utilice estos errores para configurar la gestión de fallos en Flujo o la gestión de errores en Apex.


