Fuentes de datos compatibles
Formatos compatibles
Funciones
Ingestión única
Ingestión continua
Orden lexicográfico
file1, file2 y file3 se ingestarán secuencialmente, pero si se añade un nuevo file 0 al bucket, se ignorará porque el nombre del archivo no es lexicográficamente mayor que el del último archivo ingestado.
En este modo, el S3 ClickPipe realiza una carga inicial de todos los archivos de la ruta especificada y luego consulta periódicamente si hay archivos nuevos en un intervalo configurable (de forma predeterminada, 30 segundos). Para iniciar la ingestión continua después de un archivo específico, configure Start after. ClickPipes omitirá los archivos que sean lexicográficamente menores o iguales que el valor configurado y continuará ingestando archivos más recientes a partir de ese punto.
En cualquier orden
El modo no ordenado solo es compatible con Amazon S3 y no es compatible con buckets públicos ni con servicios compatibles con S3. Requiere configurar una cola de Amazon SQS conectada al bucket, opcionalmente con Amazon EventBridge como enrutador de eventos.
ObjectCreated:* en la cola que coincidan con la ruta especificada. Cualquier mensaje de un archivo ya visto, de un archivo que no coincida con la ruta o de un evento de otro tipo se ignorará. Para ingerir solo archivos entregados a través de la cola, habilita Omitir carga inicial. Cuando está habilitado, ClickPipes omite el análisis inicial de los archivos existentes en la ruta seleccionada y procesa solo los archivos entregados a través de la cola de SQS.
Configurar un prefijo/sufijo para los eventos es opcional. Si lo haces, asegúrate de que coincida con la ruta configurada para el ClickPipe. S3 no permite múltiples reglas de notificación superpuestas para los mismos tipos de eventos.
max insert bytes o max file count, o después de un intervalo configurable (30 segundos de forma predeterminada). Si se configura una DLQ, los mensajes fallidos se volverán a encolar y se reprocesarán hasta el número de veces configurado en el parámetro maxReceiveCount de la DLQ.
De EventBridge a SQS
SNS a SQS
Coincidencia de patrones de archivos
data-2024-*.csv en lugar de *.csv).
Patrones compatibles
Ejemplos:
https://bucket.s3.amazonaws.com/folder/*.csvhttps://bucket.s3.amazonaws.com/logs/**/data.jsonhttps://bucket.s3.amazonaws.com/file-?.parquethttps://bucket.s3.amazonaws.com/data-2024-*.csv.gz
Patrones no admitidos
Ejemplos:
https://bucket.s3.amazonaws.com/{documents-01,documents-02}.jsonhttps://bucket.s3.amazonaws.com/file-{1..100}.csvhttps://bucket.s3.amazonaws.com/{logs,metrics}/data.parquet
Semántica de exactly-once
Columnas virtuales
_file en la lista de asignación de columnas. La columna virtual _file contiene el nombre de archivo del objeto de origen, que puede utilizarse para consultar qué archivos se han procesado.
Control de acceso
Permisos
Bucket de S3
Cola de SQS
Autenticación
Credenciales de IAM
Credentials en Método de autenticación al configurar tu conexión de ClickPipe. Luego, introduce el ID de la clave de acceso (por ejemplo, AKIAIOSFODNN7EXAMPLE) y la clave de acceso secreta (por ejemplo, wJalrXUtnFEMI/K7MDENG/bPxRfiCYEXAMPLEKEY) en Access key y Secret key, respectivamente.
IAM role
IAM role en Método de autenticación al configurar tu conexión de ClickPipe.
Sigue esta guía para crear un rol con la política de confianza necesaria para acceder a S3. Luego, indica el ARN del rol de IAM en IAM role ARN.
Acceso de red
-
Para el control de acceso basado en IP, la política del bucket de S3 debe permitir las IP estáticas de la región del servicio ClickPipes indicadas aquí, así como las IP estáticas del servicio ClickHouse Cloud. Para obtener las IP estáticas de su región de ClickHouse Cloud, abra una terminal y ejecute:
-
Para el control de acceso basado en endpoints de VPC, el bucket de S3 debe estar en la misma región que el servicio ClickHouse Cloud y restringir las operaciones
GetObjecta los ID de los endpoints de VPC del servicio ClickHouse Cloud. Para obtener los endpoints de VPC de su región de ClickHouse Cloud, abra una terminal y ejecute: