Usted está aquí:
Comparar métodos de federación de datos
Los datos se pueden federar a través de consultas en vivo, consultas aceleradas en la memoria caché de datos local o a través de Federación de archivos. Cada opción admite diferentes casos de uso. Las consideraciones de rendimiento, actualización de datos y consumo de crédito varían.
Comprender las diferencias entre los tres tipos de federación de datos le ayuda a seleccionar el método correcto para su caso de uso.
Federación de consultas en vivo
Las consultas en vivo se ejecutan en tiempo real y devuelven nuevos resultados desde el origen de datos.
- Casos de uso: La federación de datos de consultas en vivo es la mejor para análisis interactivos y paneles en tiempo real. Optimizado para consultas poco frecuentes. La federación de datos de consultas en vivo admite la personalización en tiempo real y flujos de trabajo dinámicos.
- Ubicación de origen de datos: Lagos de datos externos
- Actualización de datos: Las consultas se ejecutan en tiempo real. La actualización general de los datos depende de la frecuencia con la que se actualicen los datos de origen. La federación de datos de consultas en vivo admite decisiones de subsegundos.
- Controladores de rendimiento: Muy dependiente del rendimiento del sistema de origen externo. Optimizado cuando los predicados y las agregaciones se pueden enviar al origen.
- Consideraciones sobre el consumo de crédito:
- Los créditos se consumen por consulta basándose en el número de filas a las que se accede. Los créditos se consumen principalmente en el tipo de uso Federación de datos y Acceso a datos compartidos.
- Las consultas en vivo pueden ser rentables para consultas poco frecuentes. Sin embargo, las consultas frecuentes sobre datos que cambian con poca frecuencia pueden dar como resultado el consumo repetido de créditos para consultar los mismos datos, haciendo que esta opción sea más costosa que las consultas aceleradas.
Federación de consultas aceleradas
Cuando se activa la aceleración para la federación de consultas, Data 360 mantiene una memoria caché de datos local que se actualiza a intervalos establecidos. Las consultas aceleradas acceden a la memoria caché de datos local en vez de consultar el origen de datos directamente.
- Casos de uso: La federación de datos acelerada es mejor cuando las consultas son frecuentes y los datos no cambian con frecuencia. La activación de la aceleración mejora el rendimiento para patrones de acceso frecuentes manteniendo una caché local actualizada en intervalos programados. La federación de datos acelerada es adecuada para paneles y segmentación. Si sus datos cambian con más frecuencia de lo que se actualiza su caché, la aceleración no es adecuada para decisiones de subsegundos.
- Ubicación de origen de datos: Lago de datos externo
- Actualización de datos: La actualización depende del intervalo de caché seleccionado, que es configurable de 15 minutos a 7 días.
- Controladores de rendimiento: Reduce la latencia en comparación con consultas en vivo repetidas.
- Consideraciones sobre el consumo de crédito:
- Los créditos se consumen por fila de datos agregados o actualizados en la memoria caché. Los créditos se consumen en el tipo de uso Canalizaciones de datos por lotes cuando se actualiza la memoria caché.
- Los créditos también se consumen mediante el uso de consultas de datos cuando se consulta la memoria caché.
- La caché de consulta acelerada puede contribuir al uso del almacenamiento de Data 360 de su organización.
- El consumo de crédito para consultas aceleradas es similar al consumo de crédito para la misma cantidad de datos por lotes a través de la introducción de datos por lotes.
Federación de archivos
En Federación de archivos, Data 360 utiliza metadatos del origen de datos para crear tablas virtuales, que se utilizan para acceder y leer archivos en el origen de datos.
- Casos de uso: Federación de archivos es la mejor para el procesamiento por lotes a gran escala y para la IA y el aprendizaje automático modelo de entrenamiento. Federación de archivos es ideal para análisis históricos y creación de informes a escala de petabytes. No es adecuado para paneles en tiempo real.
- Ubicación de origen de datos: Almacenamientos de objetos en la nube o lagos de datos en la nube
- Actualización de datos: La actualización depende de la frecuencia con la que se actualicen los archivos de origen.
- Controladores de rendimiento: El rendimiento depende en gran medida del formato del objeto, la partición y el rendimiento del sistema externo. Utilice formatos particionados y de columnas (Parquet).
- Consideraciones sobre el consumo de crédito:
- Cuando utilice una configuración de AWS que esté en la misma región que su arrendatario de Data 360, los créditos no se consumen para las filas a las que se accede. Por ejemplo, si el cliente tiene datos en S3 en EE.UU.-Este-1 y su arrendatario de Data 360 también está en EE.UU.-Este-1, los créditos no se consumen para filas a las que Data 360 accede desde el origen de datos del cliente.
- Si su configuración de AWS en una región diferente a su arrendatario de Data 360 o utiliza una nube diferente, como Azure, consume créditos para filas a las que accedió.
