SELECT en una tabla de Hive en HDFS. Actualmente, admite los siguientes formatos de entrada:
-
Text: solo admite tipos de columna escalares simples, excepto
binary -
ORC: admite tipos de columna escalares simples, excepto
char; solo admite tipos complejos comoarray -
Parquet: admite todos los tipos de columna escalares simples; solo admite tipos complejos como
array
Crear una tabla
- Los nombres de las columnas deben ser los mismos que en la tabla original de Hive, pero puede usar solo algunas de ellas y en cualquier orden; además, puede usar columnas con alias calculadas a partir de otras columnas.
- Los tipos de las columnas deben ser los mismos que en la tabla original de Hive.
- La expresión de particionado debe ser coherente con la tabla original de Hive, y las columnas usadas en esa expresión deben estar en la estructura de la tabla.
-
thrift://host:port— Dirección de Hive Metastore -
database— Nombre de la base de datos remota. -
table— Nombre de la tabla remota.
Ejemplo de uso
Cómo usar la caché local para el sistema de archivos HDFS
config.xml
- enable: ClickHouse mantendrá una caché local para el sistema de archivos remoto (HDFS) después del inicio si es true.
- root_dir: Obligatorio. El directorio raíz donde se almacenan los archivos de la caché local del sistema de archivos remoto.
- limit_size: Obligatorio. El tamaño máximo (en bytes) de los archivos de la caché local.
- bytes_read_before_flush: Controla la cantidad de bytes antes de hacer flush en el sistema de archivos local al descargar un archivo desde el sistema de archivos remoto. El valor predeterminado es 1 MB.