Skip to main content
هذه الإعدادات متوفرة في system.settings، وهي مُولَّدة تلقائيًا من الملف المصدر.

join_algorithm

يحدد خوارزمية JOIN المستخدمة. يمكن تحديد عدة خوارزميات، وتُختار الخوارزمية المناسبة لكل استعلام بحسب kind/صرامة ومحرك الجدول. لا يُعدّ تحديد ما إذا كانت خوارزمية قائمة على hash ستكتب إلى القرص جزءًا من هذا الاختيار: إذ إن max_bytes_before_external_join / max_bytes_ratio_before_external_join هما عتبة الكتابة إلى القرص لجميعها (وبمجرد أن تصبح إحدى القيمتين غير صفرية، يمكن لـ enable_adaptive_memory_spill_scheduler كتابة join إلى القرص في وقت أبكر عند ضغط الذاكرة)، بينما يُعدّ max_rows_in_join / max_bytes_in_join حدًا صارمًا لجميعها، ما لم يُعد legacy_join_size_limits_trigger_spilling الحدين إلى كونهما محفزين للكتابة إلى القرص. تحدد القيمة التي تختارها كيفية كتابة join إلى القرص: إذ يقسم grace_hash الجدول الأيمن بدءًا من الكتلة الأولى، بينما يجمعه hash وparallel_hash في الذاكرة ويتحولان إلى الكتابة إلى القرص عند تجاوز العتبة. تؤثر معظم الخوارزميات في الاستعلام فقط عندما تكون هي الخوارزمية المحددة له. لكن بعضها يغيّر التخطيط بمجرد إدراجه، حتى لو كان خيارًا احتياطيًا منخفض الأولوية لا يُختار في النهاية، لأن القرار يُتخذ قبل اختيار الخوارزمية. ويوجد تأثيران من هذا النوع:
  • يصبح استدلال النوع لـ مفتاح الربط أكثر صرامة (فعلى سبيل المثال، لا يمكن لـ merge join ضم مفاتيح من أنواع مختلفة مثل String وNullable(String)). قد يغيّر ذلك الأنواع الناتجة لأعمدة USING، وقد يؤدي إلى فشل join مع جدول ذات engine من نوع Join بسبب TYPE_MISMATCH. يتم تفعيله بواسطة full_sorting_merge وparallel_full_sorting_merge.
  • يحصل ORDER BY ... LIMIT على الجانب المحفوظ من join على sort صريح بدلًا من قراءة بترتيب primary key، لأن join يُفترض أنه يقطع القراءة المرتبة (تُدرج merge join sort خاصًا بها قبل join؛ وتُعيد partial merge join فرز كتل اليسرى؛ كما أن join التي يمكنها إنتاج كتل مؤجلة لا تنشر القراءة المرتبة أيضًا). تكون النتيجة نفسها، لكن plan أقل كفاءة. يتم تفعيله بواسطة full_sorting_merge وparallel_full_sorting_merge وpartial_merge وprefer_partial_merge وgrace_hash وauto، وكذلك بواسطة قيمة غير صفرية لـ max_bytes_before_external_join / max_bytes_ratio_before_external_join.
ينطبق كلاهما حتى عندما يُنفذ الاستعلام في النهاية باستخدام hash أو خوارزمية أخرى. إذا كان ذلك غير مرغوب فيه، فلا تدرج الخوارزميات المذكورة أعلاه في join_algorithm للاستعلامات المتأثرة. القيم الممكنة:
  • grace_hash
تُستخدم Grace hash join. توفّر Grace hash خيار خوارزمية يتيح تنفيذ joins معقدة بكفاءة مع الحد من استهلاك الذاكرة. يكون grace_hash خارجيًا بدءًا من الكتلة الأولى: إذ يُقسَّم الجدول الأيمن فورًا، بينما يجمعه hash وparallel_hash في الذاكرة أولًا ولا يقسمانه إلا بعد تجاوز عتبة الكتابة إلى القرص. اختره عندما تعرف مسبقًا أن الجانب الأيمن لن يتسع في الذاكرة وتريد تجاوز المرحلة داخل الذاكرة. عتبة الكتابة إلى القرص نفسها هي التي تستخدمها كل خوارزمية hash، وهي max_bytes_before_external_join / max_bytes_ratio_before_external_join، ويجب أن تكون إحدى القيمتين غير صفرية ما لم يكن legacy_join_size_limits_trigger_spilling مفعّلًا. دون عتبة، يُتجاوز grace_hash إلى الخوارزمية التالية في القائمة، ويُرفض إذا كان الخوارزمية الوحيدة. تقرأ المرحلة الأولى من grace join الجدول الأيمن وتقسّمه إلى N حاوية بحسب قيمة hash لأعمدة المفتاح (يكون N في البداية grace_hash_join_initial_buckets). ويتم ذلك بطريقة تضمن إمكانية معالجة كل حاوية بشكل مستقل. تُضاف rows من الحاوية الأولى إلى hash جدول في الذاكرة بينما تُحفظ البقية على القرص. وإذا تجاوز حجم hash جدول عتبة الإفراغ على القرص، يزداد عدد الحاويات مع إعادة تعيين الحاوية المخصصة لكل row. وأي rows لا تنتمي إلى الحاوية الحالية تُفرَّغ ويُعاد تعيينها. يدعم INNER/LEFT/RIGHT/FULL ALL/ANY JOIN.
  • hash
تُستخدم Hash join algorithm. وهي التنفيذ الأكثر عمومية الذي يدعم جميع تركيبات النوع وصرامة ومفاتيح الربط المتعددة المجموعة باستخدام OR في قسم JOIN ON. عند استخدام خوارزمية hash، يُرفَع الجزء الأيمن من JOIN إلى الذاكرة.
  • parallel_hash
صيغة من join hash تقسّم البيانات إلى حاويات وتبني عدة جداول hash بدلًا من واحدة بشكل متزامن لتسريع هذه العملية. عند استخدام خوارزمية parallel_hash، يُرفَع الجزء الأيمن من JOIN إلى الذاكرة.
  • partial_merge
صيغة من sort-merge algorithm، حيث يُفرز الجدول الأيمن وحده فرزًا كاملًا. لا يُدعم RIGHT JOIN وFULL JOIN إلا مع صرامة من نوع ALL (أما SEMI وANTI وANY وASOF فغير مدعومة). عند استخدام خوارزمية partial_merge، يفرز ClickHouse البيانات ويكتبها على القرص. تختلف خوارزمية partial_merge في ClickHouse قليلًا عن التنفيذ التقليدي. أولًا، يفرز ClickHouse الجدول الأيمن بحسب مفاتيح JOIN على شكل كتل وينشئ min-max index للـ كتل المرتبة. ثم يفرز أجزاءً من الجدول الأيسر بحسب مفتاح الربط ويجري join لها مع الجدول الأيمن. ويُستخدم min-max index أيضًا لتخطي كتل غير الضرورية من الجدول الأيمن.
  • direct
تجري خوارزمية direct (المعروفة أيضًا باسم nested loop) عملية lookup في الجدول الأيمن باستخدام rows من الجدول الأيسر كمفاتيح. وهي مدعومة في أنواع تخزين خاصة مثل Dictionary وEmbeddedRocksDB وجداول من نوع MergeTree. بالنسبة إلى MergeTree جداول، تدفع الخوارزمية مرشحات مفتاح JOIN مباشرةً إلى storage layer. وقد يكون ذلك أكثر كفاءة عندما يتمكن المفتاح من استخدام primary key index الخاص بالجدول في عمليات lookup، وإلا فإنها تُجري فحصًا كاملًا للجدول الأيمن لكل كتلة من الجدول الأيسر. يدعم INNER وLEFT joins، ومفاتيح JOIN أحادية العمود للمساواة فقط، من دون شروط أخرى.
  • auto
عند ضبطه على auto، تتم تجربة join hash أولًا، ثم يجري التبديل تلقائيًا أثناء التنفيذ إلى خوارزمية أخرى إذا تم تجاوز memory limit.
  • full_sorting_merge
Sort-merge algorithm مع فرز كامل للجداول الموصولة قبل تنفيذ join.
  • ie_join
خوارزمية IEJoin المعتمدة على الفرز، والمخصصة لـ JOIN يحتوي قسم ON فيه على مقارنتين لعدم المساواة (< و<= و> و>=) بين تعبيرات الجداول الموصولة. تدعم ALL INNER/LEFT/RIGHT/FULL JOIN وSEMI/ANTI LEFT/RIGHT JOIN. يحدد موضعها في القائمة الأولوية: فإذا أُدرجت بعد الخوارزميات الأخرى، كما في القيمة الافتراضية، فلا تُستخدم IEJoin إلا عندما لا تنطبق تلك الخوارزميات (أي عندما لا يحتوي قسم ON على شروط مساواة)؛ وإذا أُدرجت أولًا، فتُستخدم كلما احتوى قسم ON على شرطي عدم مساواة. تُطبَّق الشروط المتبقية (بما فيها شروط المساواة) كـ عامل تصفية على نتيجة join بالنسبة إلى ALL INNER JOIN، وتُقيَّم داخل operator كشرط متبقٍ يؤثر في المطابقة للأنواع الأخرى. عندما يحتوي قسم ON على أكثر من شرطي عدم مساواة مؤهلين، يُختار الشرطان اللذان تستخدمهما الخوارزمية بحسب انتقائيتهما المقدرة من إحصاءات الحد الأدنى/الأقصى للأعمدة (راجع النوع basic في إحصاءات الأعمدة)؛ وعندما لا تتوفر التقديرات (لعدم وجود إحصاءات، أو عند تعطيل use_statistics)، يُستخدم أول شرطيْن وفق ترتيب الصياغة. من دون ie_join في القائمة، يُنفَّذ INNER JOIN الذي لا يحتوي إلا على شروط عدم مساواة بوصفه CROSS JOIN مع عامل تصفية، ولا تُدعَم الأنواع الأخرى. يُجمَّع كلا الإدخالين في memory قبل joining: يحدّ كل من max_rows_in_join وmax_bytes_in_join الإدخال المتراكم لكلا الجانبين معًا (وليس right side فقط)، مع تحديد الإجراء عند overflow عبر join_overflow_mode؛ ولا تُحتسب ضمن الحد فهارس sort التي يبنيها المشغّل فوق الإدخال المتراكم. ويعمل مشغّل join نفسه في خيط تنفيذ واحد؛ ولا يجري التوازي إلا في عمليات sort السابقة لـ join على الإدخالات.
  • parallel_full_sorting_merge
مماثل لـ full_sorting_merge، لكن joins القائمة على equality والمتوافقة مع hash تُقسَّم إلى shards بحسب hash الخاص بمفاتيح الربط إلى merge joins مستقلة لكل shard تعمل بالتوازي (حتى max_threads)، بدلًا من merge join واحدة. وهذا يحافظ على memory usage المنخفض والمتدفق الخاص بـ merge join مع استخدام جميع خيوط التنفيذ، ولا تكون النتيجة مرتبة. ولا يُطبَّق التقسيم إلى shards بحسب hash لمفاتيح الربط إلا على joins القائمة على equality البسيطة على أنواع مفاتيح يتسق hash الخاص بها مع مقارنة merge-join، وفقط عندما لا يكون أي من الجانبين مرتبًا مسبقًا. ويُتخطّى في الحالات التالية:
  • joins من نوع ASOF، وأنواع المفاتيح floating-point وJSON وObject وDynamic: إذ لا تتسق hashes الخاصة بها مع مقارنة merge-join، ولذلك قد تصل المفاتيح المتساوية إلى shards مختلفة.
  • الجوانب المرتبة مسبقًا (قراءة MergeTree بالترتيب، أو أي إدخال مرتب مسبقًا): قد يؤدي scatter المحافظ على الترتيب إلى merge joins لكل shard إلى حدوث deadlock في pipeline. ويُحتفَظ بدلًا من ذلك بالقراءة بالترتيب وتحسينها read_in_order_use_virtual_row.
  • أثناء قيام initiator ببناء distributed plan (make_distributed_plan)، لأن scattered sort غير قابل للتسلسل من أجل التنفيذ عن بُعد. تُعيد local single-fragment plan وfragments الخاصة بكل worker التحسين مع تعطيل ذلك الإعداد، ولذلك لا يزال بإمكانها التقسيم إلى shards.
تخطّيه يعطّل هذا الـ rewrite فقط، وليس التوازي عمومًا: إذ يُنفَّذ join بوصفه full_sorting_merge واحدة، ولا يزال بالإمكان تقسيم جوانب MergeTree المقروءة بالترتيب إلى shards عند المصدر بحسب ranges الخاصة بـ primary key (والتي تُرتَّب بالمقارنة نفسها التي يستخدمها join، ولذلك تبقى المفاتيح المتساوية معًا) عندما يكون query_plan_join_shard_by_pk_ranges مفعّلًا.
  • prefer_partial_merge
يحاول ClickHouse دائمًا استخدام join من نوع partial_merge إن أمكن، وإلا فإنه يستخدم hash. تم إهمال، مماثل لـ partial_merge,hash.
  • default (تم إهمال)
قيمة قديمة، يُرجى عدم استخدامها بعد الآن. مماثلة لـ direct,hash، أي محاولة استخدام direct join ثم hash join (بهذا الترتيب).

join_any_take_last_row

يغيّر سلوك عمليات JOIN ذات الصرامة ANY عندما يحتوي الجدول الأيمن على أكثر من صف مطابق واحد للمفتاح.
ينطبق هذا الإعداد على جداول محرك Join وخوارزميات JOIN المعتمدة على hash.إذا تم إنشاء JOIN بالتوازي، فقد يصبح ترتيب الصفوف غير حتمي. وهذا يعني أن join_any_take_last_row = 1 قد يعيد صفًا غير حتمي في استعلامات ANY JOIN.
القيم الممكنة:
  • 0 — إذا كان الجدول الأيمن يحتوي على أكثر من صف مطابق واحد، فلن يُضم إلا أول صف يتم العثور عليه.
  • 1 — إذا كان الجدول الأيمن يحتوي على أكثر من صف مطابق واحد، فلن يُضم إلا آخر صف يتم العثور عليه.
انظر أيضًا:

join_default_strictness

يضبط درجة الصرامة الافتراضية لعبارات JOIN. القيم الممكنة:
  • ALL — إذا كان الجدول الأيمن يحتوي على عدة صفوف متطابقة، ينشئ ClickHouse حاصلًا كارتيسيًا من الصفوف المتطابقة. وهذا هو سلوك JOIN المعتاد في standard SQL.
  • ANY — إذا كان الجدول الأيمن يحتوي على عدة صفوف متطابقة، فلا يُضم سوى أول صف يُعثر عليه. وإذا كان الجدول الأيمن يحتوي على صف متطابق واحد فقط، فستكون نتائج ANY وALL متطابقة.
  • ASOF — لربط التسلسلات ذات المطابقة غير المؤكدة.
  • Empty string — إذا لم يتم تحديد ALL أو ANY في الاستعلام، يطرح ClickHouse استثناء.

join_on_disk_max_files_to_merge

يحدّ من عدد الملفات المسموح به للفرز المتوازي في عمليات MergeJoin عند تنفيذها على القرص. كلما زادت قيمة الإعداد، زاد استخدام RAM وقلّت الحاجة إلى عمليات الإدخال/الإخراج على القرص. القيم الممكنة:
  • أي عدد صحيح موجب يبدأ من 2.

join_output_by_rowlist_perkey_rows_threshold

الحد الأدنى لمتوسط عدد الصفوف لكل مفتاح في الجدول الأيمن، لتحديد ما إذا كان سيتم إخراج النتائج وفق قائمة الصفوف في hash join.

join_overflow_mode

يحدّد هذا الإعداد الإجراء الذي ينفّذه ClickHouse عندما تصل عملية join إلى أيٍّ من الحدود التالية: تُراعي هذا الإعداد جميع قيم join_algorithm القائمة على التجزئة، بما فيها تلك التي تكتب إلى القرص: فبلوغ الحد يوقف الاستعلام بدلًا من أن يستدعي الكتابة إلى القرص. والاستثناء هو legacy_join_size_limits_trigger_spilling: فعند تفعيله، يواصل الجزء من عملية join الذي يعمل أصلًا على القرص الكتابة إليه بدلًا من التصرّف وفق هذا الإعداد. كما تراعيه ie_join على الإدخال الذي تجمعه من كلا الجانبين. أما partial_merge فلا تزال تتعامل مع هذه الحدود بتبديل الاستراتيجية — راجع join_algorithm. القيم الممكنة:
  • THROW — يطرح ClickHouse استثناءً ويوقف الاستعلام.
  • BREAK — يوقف ClickHouse الاستعلام ولا يطرح استثناءً.
القيمة الافتراضية: THROW. انظر أيضًا

join_use_nulls

يحدّد هذا الإعداد سلوك JOIN. عند دمج الجداول، قد تظهر خلايا فارغة. ويملؤها ClickHouse بطرق مختلفة وفقًا لهذا الإعداد. Possible values:
  • 0 — تُملأ الخلايا الفارغة بالقيمة الافتراضية لنوع الحقل المقابل.
  • 1 — يتصرف JOIN بالطريقة نفسها كما في standard SQL. ويُحوَّل نوع الحقل المقابل إلى Nullable، وتُملأ الخلايا الفارغة بـ NULL.
آخر تعديل في ٢٦ سبتمبر ٢٠٢٦