input_format_allow_errors_num
Définit le nombre maximal d’erreurs tolérées lors de la lecture de formats texte (CSV, TSV, etc.). La valeur par défaut est 0. Utilisez-le toujours avecinput_format_allow_errors_ratio.
Si une erreur se produit lors de la lecture de lignes, mais que le compteur d’erreurs reste inférieur à input_format_allow_errors_num, ClickHouse ignore la ligne et passe à la suivante.
Si les seuils de input_format_allow_errors_num et de input_format_allow_errors_ratio sont tous deux dépassés, ClickHouse lève une exception.
input_format_allow_errors_ratio
Définit le pourcentage maximal d’erreurs autorisé lors de la lecture de formats textuels (CSV, TSV, etc.). Le pourcentage d’erreurs est défini sous la forme d’un nombre à virgule flottante compris entre 0 et 1. La valeur par défaut est 0. Utilisez-le toujours avecinput_format_allow_errors_num.
Si une erreur se produit lors de la lecture de lignes, mais que le compteur d’erreurs reste inférieur à input_format_allow_errors_ratio, ClickHouse ignore la ligne et passe à la suivante.
Si input_format_allow_errors_num et input_format_allow_errors_ratio sont tous deux dépassés, ClickHouse lève une exception.
input_format_allow_seeks
Autorise les repositionnements de lecture (ou les lectures par plage) lors de la lecture des formats d’entrée ORC, Parquet et Arrow. Lorsqu’elle est activée et que la source le permet (par ex. fichier local, S3, HTTP avec prise en charge des plages et taille connue), ClickHouse peut lire uniquement les plages d’octets nécessaires et utiliser moins de mémoire. Lorsqu’elle est désactivée, ou lorsque la source ne prend pas en charge les repositionnements de lecture (par ex. taille de fichier inconnue ou flux ne permettant pas le repositionnement), certains lecteurs peuvent revenir au chargement du fichier entier en mémoire. Activée par défaut.input_format_arrow_allow_missing_columns
Autoriser les colonnes manquantes lors de la lecture des formats d’entrée Arrowinput_format_arrow_case_insensitive_column_matching
Ignorer la casse lors de la correspondance entre les colonnes Arrow et les colonnes CH.input_format_arrow_skip_columns_with_unsupported_types_in_schema_inference
Ignorer les colonnes dont les types ne sont pas pris en charge lors de l’inférence du schéma pour le format Arrowinput_format_avro_allow_missing_fields
Pour le format Avro/AvroConfluent : lorsque le champ est introuvable dans le schéma, utiliser la valeur par défaut au lieu de renvoyer une erreurinput_format_avro_null_as_default
Pour le format Avro/AvroConfluent : insérer la valeur par défaut en cas de NULL et de colonne non Nullableinput_format_binary_decode_types_in_binary_format
Lire les types de données au format binaire plutôt que les noms de types dans le format d’entrée RowBinaryWithNamesAndTypesinput_format_binary_max_type_complexity
Nombre maximal de nœuds de type lors du décodage des types binaires (il ne s’agit pas de la profondeur, mais du nombre total).Map(String, UInt32) = 3 nœuds. Protège contre les entrées malveillantes. 0 = illimité.
input_format_binary_read_json_as_string
Lire les valeurs du type de données JSON sous forme de valeurs String contenant du JSON dans le format d’entrée RowBinary.input_format_bson_skip_fields_with_unsupported_types_in_schema_inference
Ignorer les champs dont les types ne sont pas pris en charge lors de l’inférence du schéma pour le format BSON.input_format_capn_proto_skip_fields_with_unsupported_types_in_schema_inference
Ignorer les colonnes de types non pris en charge lors de l’inférence du schéma pour le format CapnProtoinput_format_column_name_matching_mode
Définit le mode de correspondance des noms de colonnes lors de l’ingestion de données dans différents formats (notamment JSONEachRow, CSVWithNames, JSONColumns, BSONEachRow et RowBinaryWithNames). Modes pris en charge :- match_case : correspondance sensible à la casse
- ignore_case : correspondance insensible à la casse
- auto : essaie d’abord une correspondance sensible à la casse ; en cas d’échec, essaie une correspondance insensible à la casse.
input_format_connection_handling
Lorsque cette option est activée, si la connexion se ferme de manière inattendue, les données restantes dans le tampon sont analysées et traitées au lieu de provoquer une erreurL’activation de cette option désactive l’analyse parallèle et rend la déduplication impossible
input_format_csv_allow_cr_end_of_line
Si cette option est définie sur true, \r sera autorisé en fin de ligne s’il n’est pas suivi de \ninput_format_csv_allow_variable_number_of_columns
Ignorer les colonnes supplémentaires dans le CSV en entrée (si le fichier comporte plus de colonnes que prévu) et traiter les champs manquants dans le CSV en entrée comme des valeurs par défautinput_format_csv_allow_whitespace_or_tab_as_delimiter
Autorise l’utilisation des espaces et des tabulations (\t) comme délimiteur de champ dans les chaînes CSVinput_format_csv_arrays_as_nested_csv
Lors de la lecture d’un Array à partir de CSV, les éléments sont supposés avoir été sérialisés en CSV imbriqué, puis placés dans une chaîne de caractères. Exemple : ”[""Hello"", ""world"", ""42"""" TV""]”. Les crochets entourant le tableau peuvent être omis.input_format_csv_deserialize_separate_columns_into_tuple
Si ce paramètre est défini sur true, des colonnes distinctes écrites au format CSV peuvent être désérialisées en une colonne Tuple. Cela s’applique uniquement àTuple seul. Un Nullable(Tuple) est toujours écrit dans un seul champ CSV (voir output_format_csv_serialize_tuple_into_separate_columns) et est de même relu depuis un seul champ, jamais depuis des colonnes distinctes, quel que soit ce paramètre. L’analyse de colonnes distinctes n’est pas prise en charge pour Nullable(Tuple), car un champ initial \N est ambigu (il peut s’agir du NULL externe du tuple ou du NULL de son premier élément).
Comme un Tuple seul occupe alors un champ par élément, un \N dans le champ d’un élément direct de niveau supérieur correspond à cet élément et non à toute la colonne, de sorte que input_format_null_as_default s’applique à cet élément. Une ligne qui fournit un seul champ pour l’ensemble du tuple manque des éléments restants et est rejetée au lieu d’utiliser la valeur par défaut de la colonne. Définissez ce paramètre sur 0 pour relire un tel champ comme l’ensemble de la colonne. Un \N dans le champ d’un élément d’un Tuple imbriqué est toujours lu comme cet élément imbriqué dans son ensemble.
input_format_csv_detect_header
Détecte automatiquement l’en-tête contenant les noms et les types au format CSVinput_format_csv_empty_as_default
Considère les champs vides dans l’entrée CSV comme des valeurs par défaut.input_format_csv_enum_as_number
Traiter les valeurs enum insérées dans les formats CSV comme des indices d’enuminput_format_csv_missing_nullable_as_empty_string
Contrôle la façon dontNullable(String) est lu lorsqu’une valeur est manquante dans un CSV. Une valeur manquante correspond à un espace vide entre, avant ou après des virgules, sans être entouré de guillemets. Si ce paramètre est activé, quelle que soit la valeur de input_format_csv_empty_as_default, la valeur manquante de Nullable(String) sera interprétée comme une String vide, et non comme NULL.
input_format_csv_skip_first_lines
Ignore le nombre de lignes spécifié au début des données au format CSVinput_format_csv_skip_trailing_empty_lines
Ignorer les lignes vides en fin de CSVinput_format_csv_trim_whitespaces
Supprime les espaces et les tabulations (\t) au début et à la fin des chaînes CSVinput_format_csv_try_infer_numbers_from_strings
Si ce paramètre est activé, lors de l’inférence du schéma, ClickHouse tentera d’inférer des nombres à partir de champs de type String. Cela peut être utile si les données CSV contiennent des nombres UInt64 entre guillemets. Désactivé par défaut.input_format_csv_try_infer_strings_from_quoted_tuples
Interprète les tuples entre guillemets dans les données d’entrée comme une valeur de type String.input_format_csv_use_best_effort_in_schema_inference
Utilise divers ajustements et heuristiques pour inférer le schéma du format CSVinput_format_csv_use_default_on_bad_values
Permet de définir une valeur par défaut pour la colonne lorsque la désérialisation d’un champ CSV échoue en raison d’une valeur invalideinput_format_custom_allow_variable_number_of_columns
Ignorer les colonnes supplémentaires dans l’entrée CustomSeparated (si le fichier contient plus de colonnes que prévu) et traiter les champs manquants dans l’entrée CustomSeparated comme des valeurs par défautinput_format_custom_detect_header
Détecte automatiquement l’en-tête avec les noms et les types au format CustomSeparatedinput_format_custom_skip_trailing_empty_lines
Ignorer les lignes vides finales au format CustomSeparatedinput_format_defaults_for_omitted_fields
Lors de l’exécution de requêtesINSERT, remplacez les valeurs des colonnes d’entrée omises par les valeurs par défaut des colonnes correspondantes. Cette option s’applique aux formats JSONEachRow (et aux autres formats JSON), CSV, TabSeparated, TSKV, Parquet, Arrow, Avro, ORC, Native, ainsi qu’aux formats avec les suffixes WithNames/WithNamesAndTypes.
Lorsque cette option est activée, des métadonnées de table étendues sont envoyées du serveur au client. Cela consomme des ressources de calcul supplémentaires sur le serveur et peut réduire les performances.
- 0 — Désactivé.
- 1 — Activé.
input_format_force_null_for_omitted_fields
Forcer l’initialisation des champs omis avec des valeurs NULLinput_format_geojson_unsupported_geometry_handling
Contrôle ce qui se passe lorsqu’un type de géométrieGeoJSON valide qui ne peut pas être représenté par le type Geometry de ClickHouse (comme GeometryCollection) doit être stocké dans la colonne geometry lors de la lecture d’une entrée au format GeoJSON.
Valeurs possibles :
'throw'(par défaut) — lever une exception.'null'— insérer une valeurNULLdans la colonnegeometryet poursuivre l’analyse.
geometry est matérialisée. Lorsqu’il ne s’agit pas d’une colonne de sortie demandée, une telle géométrie est bien validée pour vérifier qu’elle est correctement formée, mais ne déclenche pas cette gestion.
input_format_hive_text_allow_variable_number_of_columns
Ignorer les colonnes supplémentaires dans l’entrée au format Hive Text (si le fichier comporte plus de colonnes que prévu) et traiter les champs manquants dans l’entrée au format Hive Text comme des valeurs par défautinput_format_hive_text_collection_items_delimiter
Délimiteur entre les éléments d’une collection (Array ou Map) dans Hive Text Fileinput_format_hive_text_fields_delimiter
Délimiteur entre les champs du fichier Hive Textinput_format_hive_text_map_keys_delimiter
Délimiteur entre la clé et la valeur d’une paire de map dans Hive Text Fileinput_format_import_nested_json
Active ou désactive l’insertion de données JSON contenant des objets imbriqués. Formats pris en charge : Valeurs possibles :- 0 — Désactivé.
- 1 — Activé.
- Utilisation des structures Nested avec le format
JSONEachRow.
input_format_ipv4_default_on_conversion_error
La désérialisation d’IPv4 utilisera les valeurs par défaut au lieu de lever une exception en cas d’erreur lors de la conversion. Désactivé par défaut.input_format_ipv6_default_on_conversion_error
La désérialisation d’IPv6 utilisera les valeurs par défaut au lieu de lever une exception en cas d’erreur de conversion. Désactivé par défaut.input_format_json_compact_allow_variable_number_of_columns
Autorise un nombre variable de colonnes dans les lignes des formats d’entrée JSONCompact/JSONCompactEachRow. Ignore les colonnes supplémentaires dans les lignes qui contiennent plus de colonnes que prévu et considère les colonnes manquantes comme des valeurs par défaut. Désactivé par défaut.input_format_json_defaults_for_missing_elements_in_named_tuple
Insère des valeurs par défaut pour les éléments manquants d’un objet JSON lors de l’analyse d’un tuple nommé. Ce paramètre fonctionne uniquement lorsque le paramètreinput_format_json_named_tuples_as_objects est activé.
Activé par défaut.
input_format_json_empty_as_default
Lorsqu’il est activé, ce paramètre remplace les champs d’entrée vides en JSON par des valeurs par défaut. Pour les expressions par défaut complexes,input_format_defaults_for_omitted_fields doit également être activé.
Valeurs possibles :
- 0 — Désactivé.
- 1 — Activé.
input_format_json_ignore_unknown_keys_in_named_tuple
Ignorer les clés inconnues dans les objets JSON pour les tuples nommés. Activé par défaut.input_format_json_ignore_unnecessary_fields
Ignorer les champs inutiles sans les analyser. Son activation peut faire qu’aucune exception ne soit levée pour des chaînes JSON au format invalide ou contenant des champs dupliquésinput_format_json_infer_array_of_dynamic_from_array_of_different_types
Si cette option est activée, lors de l’inférence du schéma, ClickHouse utilisera le type Array(Dynamic) pour les tableaux JSON contenant des valeurs de types de données différents. Exemple :input_format_json_infer_incomplete_types_as_strings
Permet d’utiliser le type String pour les clés JSON qui ne contiennent queNull/{}/[] dans l’échantillon de données lors de l’inférence du schéma.
Dans les formats JSON, toute valeur peut être lue comme String, ce qui permet d’éviter des erreurs telles que Cannot determine type for column 'column_name' by first 25000 rows of data, most likely this column contains only Nulls or empty Arrays/Maps lors de l’inférence du schéma
en utilisant le type String pour les clés de type inconnu.
Exemple :
input_format_json_map_as_array_of_tuples
Désérialise les colonnes Map sous forme de tableaux JSON de tuples. Désactivé par défaut.input_format_json_max_depth
Profondeur maximale d’un champ en JSON. Il ne s’agit pas d’une limite stricte et elle n’a pas besoin d’être appliquée avec précision.input_format_json_max_object_size
Taille maximale autorisée d’un objet JSON unique, en octets. Les objets dépassant cette limite sont rejetés, car ils sont probablement mal formés. Cela protège contre l’épuisement de la mémoire lorsqu’un document JSON mal formé est analysé comme un seul objet. La même limite s’applique aux chemins d’analyse parallèle et non parallèle. Définissez cette valeur sur 0 pour désactiver la vérification.input_format_json_max_string_column_growth_step
Lors de la création des tampons String internes de la colonne JSON pendant l’analyse d’un JSON à partir d’une chaîne, plafonnez la croissance par puissances de deux à ce nombre d’octets : une fois que la taille réservée atteint cette valeur, le tampon augmente par incréments de cette taille au lieu de doubler. Cela limite la surallocation pour les grandes colonnes JSON. 0 signifie illimité (doublement pur).input_format_json_named_tuples_as_objects
Interpréter les colonnes de tuples nommés comme des objets JSON. Activé par défaut.input_format_json_read_arrays_as_strings
Autorise l’analyse des tableaux JSON comme des chaînes dans les formats d’entrée JSON. Exemple :input_format_json_read_bools_as_numbers
Autorise l’analyse des booléens comme des nombres dans les formats d’entrée JSON. Activé par défaut.input_format_json_read_bools_as_strings
Permet d’analyser les booléens sous forme de chaînes dans les formats d’entrée JSON. Activé par défaut.input_format_json_read_numbers_as_strings
Permet d’interpréter les nombres comme des chaînes dans les formats d’entrée JSON. Activé par défaut.input_format_json_read_objects_as_strings
Permet d’analyser les objets JSON comme des chaînes dans les formats d’entrée JSON. Exemple :input_format_json_throw_on_bad_escape_sequence
Lève une exception si une chaîne JSON contient une séquence d’échappement invalide dans les formats d’entrée JSON. Si cette option est désactivée, les séquences d’échappement invalides restent telles quelles dans les données. Activé par défaut.input_format_json_try_infer_named_tuples_from_objects
Si ce paramètre est activé, lors de l’inférence du schéma, ClickHouse essaiera d’inférer un tuple nommé à partir d’objets JSON. Le tuple nommé obtenu contiendra tous les éléments de tous les objets JSON correspondants présents dans les données d’exemple. Exemple :input_format_json_try_infer_numbers_from_strings
Si ce paramètre est activé, lors de l’inférence du schéma, ClickHouse essaiera d’inférer les nombres à partir des champs String. Cela peut être utile si les données JSON contiennent des nombres UInt64 entre guillemets. Désactivé par défaut.input_format_json_use_string_type_for_ambiguous_paths_in_named_tuples_inference_from_objects
Utilise le type String au lieu de lever une exception en cas de chemins ambigus dans des objets JSON lors de l’inférence de tuples nommésinput_format_json_validate_types_from_metadata
Pour les formats d’entrée JSON/JSONCompact/JSONColumnsWithMetadata, si ce paramètre est défini sur 1, les types indiqués dans les métadonnées des données d’entrée seront comparés à ceux des colonnes correspondantes de la table. Activé par défaut.input_format_max_block_size_bytes
Limite la taille, en octets, des blocs formés lors de l’analyse des données dans les formats d’entrée. Utilisé dans les formats d’entrée basés sur les lignes lorsqu’un bloc est formé côté ClickHouse. 0 signifie qu’il n’y a pas de limite en octets.input_format_max_block_wait_ms
Limite le temps d’attente maximal, en millisecondes, avant l’émission d’un bloc lors de l’analyse des formats d’entrée basés sur les lignes. 0 signifie qu’il n’y a pas de limite.Cette option fonctionne uniquement si
input_format_connection_handling est activé. Le fait de définir une valeur désactive également l’analyse parallèle et rend la déduplication impossible.Pour les insertions en streaming, vous devez également définir
min_insert_block_size_rows=0 et min_insert_block_size_bytes=0. Sinon, les blocs analysés peuvent encore être accumulés en mémoire à l’étape de compactage des blocs jusqu’à ce que ces seuils soient atteints, ce qui empêche des insertions rapides.input_format_max_bytes_to_read_for_schema_inference
La quantité maximale de données, en octets, à lire pour l’inférence automatique de schéma.input_format_max_rows_to_read_for_schema_inference
Le nombre maximal de lignes de données à lire pour l’inférence automatique de schéma.input_format_msgpack_number_of_columns
Le nombre de colonnes dans les données MsgPack insérées. Utilisé pour l’inférence automatique de schéma à partir des données.input_format_mysql_dump_map_column_names
Faire correspondre, par leur nom, les colonnes des tables du dump MySQL avec celles de la table ClickHouseinput_format_mysql_dump_table_name
Nom de la table du dump MySQL à partir de laquelle lire les donnéesinput_format_native_allow_types_conversion
Autoriser la conversion des types de données dans le format d’entrée Nativeinput_format_native_decode_types_in_binary_format
Lire les types de données au format binaire plutôt que les noms de types dans le format d’entrée Nativeinput_format_null_as_default
Active ou désactive l’initialisation des champs NULL avec les valeurs par défaut, si le type de données de ces champs n’est pas nullable. Si le type de la colonne n’est pas nullable et que ce paramètre est désactivé, l’insertion deNULL provoque une exception. Si le type de la colonne est nullable, les valeurs NULL sont insérées telles quelles, quel que soit ce paramètre.
Ce paramètre s’applique à la plupart des formats d’entrée.
Pour les expressions par défaut complexes, input_format_defaults_for_omitted_fields doit également être activé.
Valeurs possibles :
- 0 — L’insertion de
NULLdans une colonne non nullable provoque une exception. - 1 — Les champs
NULLsont initialisés avec les valeurs par défaut de la colonne.
input_format_orc_allow_missing_columns
Autoriser les colonnes manquantes lors de la lecture des fichiers ORC en entréeinput_format_orc_case_insensitive_column_matching
Ignorer la casse lors de la mise en correspondance des colonnes ORC avec les colonnes CH.input_format_orc_dictionary_as_low_cardinality
Traiter les colonnes ORC encodées avec un dictionnaire comme des colonnes LowCardinality lors de la lecture des fichiers ORC.input_format_orc_filter_push_down
Lors de la lecture de fichiers ORC, ignore les stripes ou les groupes de lignes entiers en fonction des expressions WHERE/PREWHERE, des statistiques min/max ou du filtre de Bloom dans les métadonnées ORC.input_format_orc_reader_time_zone_name
Nom du fuseau horaire du lecteur de lignes ORC ; le fuseau horaire par défaut de ce lecteur est GMT.input_format_orc_row_batch_size
Taille du lot lors de la lecture des stripes ORC.input_format_orc_skip_columns_with_unsupported_types_in_schema_inference
Ignorer les colonnes dont le type n’est pas pris en charge lors de l’inférence de schéma pour le format ORCinput_format_parallel_parsing
Active ou désactive l’analyse parallèle des formats de données tout en préservant l’ordre. Pris en charge uniquement pour les formats TabSeparated (TSV), TSKV, CSV et JSONEachRow. Valeurs possibles :- 1 — Activé.
- 0 — Désactivé.
input_format_parquet_allow_geoparquet_parser
Utilise le parseur de colonnes géo pour convertir Array(UInt8) en types Point/MultiPoint/Linestring/Polygon/MultiLineString/MultiPolygoninput_format_parquet_allow_missing_columns
Autoriser les colonnes manquantes lors de la lecture de données d’entrée au format Parquetinput_format_parquet_bloom_filter_push_down
Lors de la lecture de fichiers Parquet, ignore des groupes de lignes entiers sur la base des expressions WHERE et du filtre de Bloom dans les métadonnées Parquet.input_format_parquet_case_insensitive_column_matching
Ignore la casse lors de la correspondance entre les colonnes Parquet et les colonnes CH.input_format_parquet_dictionary_filter_push_down
Lors de la lecture de fichiers Parquet (avec le lecteur v3), ignore les groupes de lignes entiers en fonction des expressions WHERE/PREWHERE et du contenu des pages de dictionnaire, lorsque toutes les pages de données d’un fragment de colonne sont encodées par dictionnaire. La valeur correspond à la taille maximale, en octets, des pages de dictionnaire auxquelles cette optimisation s’applique ; définissez-la sur 0 pour la désactiver. Cette optimisation prévaut sur le filtre de Bloom lorsque les deux sont disponibles.input_format_parquet_enable_json_parsing
Lors de la lecture de fichiers Parquet, interprète les colonnes JSON comme des colonnes JSON ClickHouse.input_format_parquet_enable_row_group_prefetch
Activer le préchargement des groupes de lignes lors de l’analyse de Parquet. Actuellement, seule l’analyse en mono-thread peut effectuer un préchargement.input_format_parquet_filter_push_down
Lors de la lecture de fichiers Parquet, ignore les groupes de lignes entiers en fonction des expressions WHERE/PREWHERE et des statistiques min/max des métadonnées Parquet.input_format_parquet_local_file_min_bytes_for_seek
Nombre minimal d’octets requis pour qu’une lecture locale (fichier) effectue un seek plutôt qu’une lecture avec ignore, dans le format d’entrée Parquetinput_format_parquet_local_time_as_utc
Détermine le type de données utilisé par l’inférence de schéma pour les horodatages Parquet avec isAdjustedToUTC=false. Si true : DateTime64(…, ‘UTC’), si false : DateTime64(…). Aucun des deux comportements n’est entièrement correct, car ClickHouse ne dispose pas d’un type de données pour l’heure locale au sens wall-clock time. Contre-intuitivement, true est probablement l’option la moins incorrecte, car le formatage de l’horodatage ‘UTC’ en String produira une représentation de l’heure locale correcte.input_format_parquet_max_block_size
Taille maximale de bloc pour le lecteur Parquet.input_format_parquet_memory_high_watermark
Limite de mémoire approximative du lecteur Parquet v3. Limite le nombre de groupes de lignes ou de colonnes pouvant être lus en parallèle. Lors de la lecture de plusieurs fichiers dans une même requête, la limite porte sur l’utilisation mémoire totale de l’ensemble de ces fichiers.input_format_parquet_memory_low_watermark
Planifie les préchargements de manière plus agressive si l’utilisation de la mémoire est inférieure au seuil. Peut être utile, par exemple, s’il y a de nombreux petits filtres de Bloom à lire via le réseau.input_format_parquet_page_filter_push_down
Ignorer les pages à l’aide des valeurs min./max. de l’index de colonne.input_format_parquet_prefer_block_bytes
Taille moyenne, en octets, des blocs produits par le lecteur Parquetinput_format_parquet_preserve_order
Évite de réordonner les lignes lors de la lecture de fichiers Parquet. Cette option n’est pas recommandée, car l’ordre des lignes n’est généralement pas garanti et d’autres parties du pipeline de requête peuvent aussi le perturber. Utilisez plutôtORDER BY _row_number.
input_format_parquet_skip_columns_with_unsupported_types_in_schema_inference
Ignorer les colonnes dont les types ne sont pas pris en charge lors de l’inférence de schéma pour le format Parquetinput_format_parquet_spatial_filter_push_down
Lors de la lecture de fichiers GeoParquet, ignorez des groupes de lignes entiers et, avecinput_format_parquet_page_filter_push_down, des pages individuelles, selon les prédicats spatiaux de la clause WHERE et les statistiques de boîte englobante de la géométrie (colonnes geospatial_statistics.bbox ou covering.bbox) dans les métadonnées Parquet.
input_format_parquet_use_offset_index
Ajustement mineur de la lecture des pages d’un fichier Parquet lorsqu’aucun filtrage de pages n’est utilisé.input_format_parquet_verify_checksums
Vérifie les sommes de contrôle des pages à la lecture des fichiers Parquet.input_format_protobuf_flatten_google_wrappers
Activez les wrappers Google pour les colonnes ordinaires non imbriquées, par exemple google.protobuf.StringValue ‘str’ pour la colonne String ‘str’. Pour les colonnes Nullable, les wrappers vides sont interprétés comme des valeurs par défaut, et les wrappers absents comme des nullsinput_format_protobuf_oneof_presence
Indique quel champ du oneof Protobuf est présent en définissant une valeur enum dans une colonne spécialeinput_format_protobuf_skip_fields_with_unsupported_types_in_schema_inference
Ignorer les champs dont les types ne sont pas pris en charge lors de l’inférence de schéma pour le format Protobufinput_format_read_datetime_number_as_raw_value
Interprète un entier non entre guillemets pour une colonneDateTime/DateTime64 comme la valeur brute sous-jacente — en secondes pour
DateTime, en ticks à la précision de la colonne pour DateTime64 — plutôt que comme un timestamp Unix en secondes.
Désactivé par défaut : un nombre non entre guillemets est interprété comme un timestamp Unix en secondes (avec une précision sous-seconde facultative),
conformément au format Values, à CAST et à toDateTime64. Activez-le (ou utilisez SET compatibility = '26.7') pour
rétablir le comportement des versions jusqu’à la 26.7 incluse, où un entier non entre guillemets transmis à une colonne DateTime64
était interprété comme valeur brute mise à l’échelle (ticks). Le chemin legacy n’accepte qu’un tel entier non entre guillemets :
lorsque ce paramètre est activé, un nombre comportant une partie fractionnaire ou un exposant est rejeté par les chemins d’entrée de lignes
(comme avant la version 26.8), tandis que dans JSONExtract et le type JSON typé, un nombre fractionnaire est toujours interprété comme
des secondes pour DateTime64 et rejeté pour DateTime (également comme avant la version 26.8). Dans le format Values lui-même,
un nombre rejeté par le parser de flux est alors soumis à l’évaluation d’une expression SQL et interprété comme des secondes,
avant la version 26.8 comme lorsque ce paramètre est activé — le comportement de Values pour un nombre fractionnaire est donc
identique dans toutes les configurations.
Ce paramètre régit uniquement les chemins JSON, Values/Quoted et JSONExtract/JSON typé (le chemin Quoted
couvre tous les formats qui analysent des champs avec la règle d’échappement Quoted : Values, MySQLDump et
Template/CustomSeparated/Regexp configurés avec l’échappement de champ Quoted). Les formats tabulés, CSV et les autres
formats échappés/en texte intégral ne sont pas affectés : dans ces formats, un grand nombre DateTime64 non entre guillemets est toujours interprété comme des ticks.
input_format_record_errors_file_path
Chemin du fichier utilisé pour enregistrer les erreurs lors de la lecture de formats textuels (CSV, TSV).input_format_skip_unknown_fields
Active ou désactive l’ignorance des données supplémentaires lors de l’insertion. Lors de l’écriture de données, ClickHouse lève une exception si les données d’entrée contiennent des colonnes qui n’existent pas dans la table cible. Si cette option est activée, ClickHouse n’insère pas les données supplémentaires et ne lève pas d’exception. Formats pris en charge :- JSONEachRow (et autres formats JSON)
- BSONEachRow (et autres formats JSON)
- TSKV
- Tous les formats avec les suffixes WithNames/WithNamesAndTypes
- MySQLDump
- Native
- 0 — Désactivé.
- 1 — Activé.
input_format_try_infer_dates
Si cette option est activée, ClickHouse essaiera d’inférer le typeDate à partir des champs de type chaîne lors de l’inférence de schéma pour les formats texte. Si tous les champs d’une colonne dans les données d’entrée ont été correctement analysés comme des dates, le type résultant sera Date ; si au moins un champ n’a pas été analysé comme une date, le type résultant sera String.
Activé par défaut.
input_format_try_infer_datetimes
Si cette option est activée, ClickHouse tentera d’inférer le typeDateTime64 à partir de champs texte lors de l’inférence de schéma pour les formats texte. Si tous les champs d’une colonne des données d’entrée sont correctement interprétés comme des valeurs de date et d’heure, le type résultant sera DateTime64 ; si au moins un champ ne peut pas être interprété comme une valeur de date et d’heure, le type résultant sera String.
Activé par défaut.
input_format_try_infer_datetimes_only_datetime64
Lorsque input_format_try_infer_datetimes est activé, n’inférer que DateTime64, et non les types DateTimeinput_format_try_infer_exponent_floats
Essaie d’inférer les Float en notation exponentielle lors de l’inférence de schéma dans les formats texte (sauf JSON, où les nombres en notation exponentielle sont toujours inférés)input_format_try_infer_integers
Si cette option est activée, ClickHouse essaiera d’inférer des entiers plutôt que des nombres à virgule flottante lors de l’inférence du schéma pour les formats texte. Si tous les nombres de la colonne dans les données d’entrée sont des entiers, le type résultant seraInt64 ; si au moins un nombre est à virgule flottante, le type résultant sera Float64.
Activé par défaut.
input_format_try_infer_variants
Si activé, ClickHouse tentera d’inférer le typeVariant lors de l’inférence de schéma pour les formats texte lorsqu’il existe plusieurs types possibles pour les éléments de colonnes ou de tableaux.
Valeurs possibles :
- 0 — Désactivé.
- 1 — Activé.
input_format_tsv_allow_variable_number_of_columns
Ignorer les colonnes supplémentaires dans l’entrée TSV (si le fichier contient plus de colonnes que prévu) et traiter les champs manquants dans l’entrée TSV comme des valeurs par défautinput_format_tsv_crlf_end_of_line
Si ce paramètre est défini sur true, la fonction file lira le format TSV avec \r\n au lieu de \n.input_format_tsv_detect_header
Détecte automatiquement l’en-tête contenant les noms et les types au format TSVinput_format_tsv_empty_as_default
Considère les champs vides dans l’entrée TSV comme des valeurs par défaut.input_format_tsv_enum_as_number
Traite les valeurs enum insérées dans les formats TSV comme des indices d’enum.input_format_tsv_skip_first_lines
Ignore le nombre spécifié de lignes au début des données au format TSVinput_format_tsv_skip_trailing_empty_lines
Ignorer les lignes vides en fin de fichier au format TSVinput_format_tsv_use_best_effort_in_schema_inference
Utilise divers ajustements et heuristiques pour inférer le schéma au format TSVinput_format_values_accurate_types_of_literals
Pour le format Values : lors de l’analyse et de l’interprétation des expressions à l’aide du modèle, vérifiez le type réel du littéral afin d’éviter d’éventuels problèmes de dépassement de capacité et de précision.input_format_values_deduce_templates_of_expressions
Pour le format Values : si le champ n’a pas pu être analysé par le parseur en streaming, exécuter le parseur SQL, déduire le modèle de l’expression SQL, essayer d’analyser toutes les lignes à l’aide de ce modèle, puis interpréter l’expression pour toutes les lignes.input_format_values_interpret_expressions
Pour le format Values : si le champ n’a pas pu être analysé par le parseur en flux, exécuter le parseur SQL et tenter de l’interpréter comme une expression SQL.input_format_with_names_use_header
Active ou désactive la vérification de l’ordre des colonnes lors de l’insertion de données. Pour améliorer les performances d’insertion, nous recommandons de désactiver cette vérification si vous êtes sûr que l’ordre des colonnes des données d’entrée est le même que celui de la table cible. Formats pris en charge :- CSVWithNames
- CSVWithNamesAndTypes
- TabSeparatedWithNames
- TabSeparatedWithNamesAndTypes
- JSONCompactEachRowWithNames
- JSONCompactEachRowWithNamesAndTypes
- JSONCompactStringsEachRowWithNames
- JSONCompactStringsEachRowWithNamesAndTypes
- RowBinaryWithNames
- RowBinaryWithNamesAndTypes
- CustomSeparatedWithNames
- CustomSeparatedWithNamesAndTypes
- 0 — Désactivé.
- 1 — Activé.
input_format_with_types_use_header
Contrôle si l’analyseur du format doit vérifier que les types de données des données d’entrée correspondent à ceux de la table cible. Formats pris en charge :- CSVWithNamesAndTypes
- TabSeparatedWithNamesAndTypes
- JSONCompactEachRowWithNamesAndTypes
- JSONCompactStringsEachRowWithNamesAndTypes
- RowBinaryWithNamesAndTypes
- CustomSeparatedWithNamesAndTypes
- 0 — Désactivé.
- 1 — Activé.