Skip to main content
باختصاردليل عملي للاستعلام عن جداول بحيرة البيانات، وتسريع أدائها باستخدام MergeTree، ثم كتابة النتائج مجددًا إلى Iceberg. تستخدم جميع الخطوات مجموعات بيانات عامة، وتعمل على كلٍّ من Cloud وOSS.
لقطات الشاشة في هذا الدليل مأخوذة من ClickHouse Cloud وحدة تحكم SQL. تعمل جميع الاستعلامات على كلٍّ من Cloud وعمليات النشر المُدارة ذاتيًا. يوفّر ClickHouse ثلاث طرق لقراءة تنسيقات الجداول المفتوحة: دوال الجداول، ومحركات الجداول، ومحرك قاعدة البيانات DataLakeCatalog. إذا كانت جداولك موجودة في Data Catalog ‏(Glue وUnity Catalog وREST وغيرها)، فاتصل عبر DataLakeCatalog لتتمكن من الوصول إلى جميع جداول Iceberg/Delta لديك من خلال دالة واحدة. أمّا قسمَا دالة الجدول ومحرك الجدول أدناه فهما الأنسب للاستعلامات المخصّصة أو عندما تعرف path تخزينًا محددًا ولا تستخدم كتالوجًا.
1

استعلم عن بيانات Iceberg مباشرة

أسرع طريقة للبدء — خاصةً للاستعلامات المخصّصة أو عندما لا تستخدم كتالوجًا — هي استخدام دالة الجدول icebergS3(). وجّهها إلى جدول Iceberg في S3 ونفّذ استعلامًا فورًا، من دون أي إعداد.افحص المخطط:
نفّذ استعلامًا:
يقرأ ClickHouse البيانات الوصفية لـ Iceberg مباشرةً من S3 ويستنتج المخطط تلقائيًا. وينطبق النهج نفسه على deltaLake() وhudi() وpaimon().تعرّف على المزيد: يتناول الاستعلام عن تنسيقات الجداول المفتوحة مباشرةً التنسيقات الأربعة، ومتغيرات cluster للقراءة الموزعة، وخيارات الواجهة الخلفية للتخزين (S3 وAzure وHDFS وlocal).
2

أنشئ جدولًا دائمًا باستخدام محرك جدول Iceberg

عندما لا تستخدم كتالوجًا ولكنك ستنفّذ استعلامات على المسار نفسه بشكل متكرر، أنشئ جدولًا باستخدام محرك جدول Iceberg حتى لا تحتاج إلى تمرير المسار في كل مرة. تبقى البيانات في S3 — ولا تُنسخ أي بيانات:
يمكنك الآن الاستعلام عنه كما تفعل مع أي جدول في ClickHouse:
يدعم محرك الجدول التخزين المؤقت للبيانات، والتخزين المؤقت للبيانات الوصفية، وتطوّر المخطط، والسفر عبر الزمن. راجع دليل الاستعلام مباشرةً للحصول على تفاصيل حول ميزات محرك الجدول، ومصفوفة الدعم للاطلاع على مقارنة شاملة للميزات.
3

الاتصال بكتالوج

إذا كانت مؤسستك تستخدم كتالوج بيانات، فهذا هو مسار التكامل الذي نوصي به. تعمل الكتالوجات على تجميع البيانات الوصفية للجداول واكتشافها في مكان مركزي — وبدلًا من إدارة تعريف جدول لكل مسار تخزين، اتصل مرة واحدة باستخدام محرك قاعدة البيانات DataLakeCatalog. يظهر كل جدول في الكتالوج كجدول ClickHouse، بما في ذلك الجداول التي أُضيفت upstream بعد إنشاء الاتصال.
موصى به عند استخدام كتالوجاستخدم DataLakeCatalog لأعباء العمل في production مع Glue وUnity Catalog وREST والكتالوجات المدعومة الأخرى. تعمل دوال الجداول ومحركات الجداول عندما تعرف مسارًا محددًا، لكنها لا تظل متزامنة مع نمو الكتالوج لديك وتتطلب بيانات اعتماد أو مسارات منفصلة لكل جدول.
إليك مثالاً على الاتصال بـ AWS Glue:
يتطلب كل نوع من أنواع الكتالوجات إعدادات اتصال خاصة به — راجع أدلة الكتالوجات للاطّلاع على القائمة الكاملة بالكتالوجات المدعومة وخيارات تهيئتها.تصفّح الجداول ونفّذ استعلامًا:
علامات الاقتباس المعكوسة مطلوبة حول <database>.<table> لأن ClickHouse لا يدعم بشكل أصلي أكثر من نطاق أسماء واحد.
تعرّف على المزيد: يشرح الاتصال بـ Data Catalog إعداد Unity Catalog كاملًا مع أمثلة على Delta وIceberg.
4

نفِّذ استعلامًا

بصرف النظر عن الطريقة التي استخدمتها أعلاه — دالة الجدول أو محرك الجدول أو DataLakeCatalog — فإن ClickHouse SQL نفسه يعمل في جميعها. وفي بيئة الإنتاج عند استخدام كتالوج، نفِّذ الاستعلام عبر قاعدة البيانات DataLakeCatalog؛ وتظل الأمثلة الأخرى مفيدة للاختبارات السريعة والوصول المستند إلى path:
صياغة الاستعلام متطابقة — والتغيير الوحيد يكون في عبارة FROM. تعمل جميع الدوال وعمليات JOIN وعمليات التجميع في ClickHouse SQL بالطريقة نفسها بغضّ النظر عن مصدر البيانات.
5

حمّل مجموعة فرعية إلى ClickHouse

يُعد الاستعلام عن Iceberg مباشرةً أمرًا مناسبًا، لكن الأداء يظل محدودًا بمعدل نقل الشبكة وتخطيط الملفات. بالنسبة إلى أعباء العمل التحليلية، حمّل البيانات إلى جدول MergeTree أصلي.أولًا، شغّل استعلامًا مُرشَّحًا على جدول Iceberg للحصول على خط أساس:
يفحص هذا الاستعلام مجموعة البيانات بالكامل في S3 لأن Iceberg لا يراعي عامل التصفية counterid — لذا توقّع أن يستغرق ذلك عدة ثوانٍ.الآن أنشئ جدول MergeTree وحمّل البيانات:
أعِد تنفيذ الاستعلام نفسه على جدول MergeTree:
نظرًا لأن counterid هو العمود الأول في مفتاح ORDER BY، فإن الفهرس الأساسي المتناثر في ClickHouse يتخطّى مباشرةً إلى وحدات granule ذات الصلة، فلا يقرأ إلا الصفوف الخاصة بـ counterid = 38 بدلًا من فحص جميع الصفوف المئة مليون. والنتيجة هي تسارع كبير جدًا.يمضي دليل تسريع التحليلات إلى ما هو أبعد من ذلك باستخدام الأنواع LowCardinality، وفهارس النص الكامل، ومفاتيح ترتيب محسّنة، مع عرض تحسّن بنحو ~40x على مجموعة بيانات تضم 283 مليون صف.اعرف المزيد: يغطّي تسريع التحليلات باستخدام MergeTree تحسين المخطط، وفهرسة النص الكامل، ومقارنة كاملة للأداء قبل وبعد.
6

الكتابة مرة أخرى إلى Iceberg

يمكن لـ ClickHouse أيضًا كتابة البيانات مرة أخرى إلى جداول Iceberg، مما يتيح سير عمل ETL العكسي — من خلال نشر النتائج المُجمَّعة أو مجموعات فرعية لتستخدمها أدوات أخرى (Spark وTrino وDuckDB وغيرها).أنشئ جدول Iceberg للمخرجات:
اكتب النتائج المجمَّعة:
يمكن لأي محرّك متوافق مع Iceberg قراءة جدول Iceberg الناتج.تعرّف على المزيد: يشرح كتابة البيانات إلى تنسيقات الجداول المفتوحة كيفية كتابة البيانات الخام والنتائج المجمّعة باستخدام مجموعة بيانات UK Price Paid، بما في ذلك اعتبارات المخطط عند مواءمة أنواع ClickHouse مع Iceberg.

الخطوات التالية

بعد أن اطّلعت الآن على سير العمل الكامل، تعمّق أكثر في كل جانب:
آخر تعديل في ١٤ أغسطس ٢٠٢٦