باختصاردليل عملي للاستعلام عن جداول بحيرة البيانات، وتسريع أدائها باستخدام MergeTree، ثم كتابة النتائج مجددًا إلى Iceberg. تستخدم جميع الخطوات مجموعات بيانات عامة، وتعمل على كلٍّ من Cloud وOSS.
DataLakeCatalog. إذا كانت جداولك موجودة في Data Catalog (Glue وUnity Catalog وREST وغيرها)، فاتصل عبر DataLakeCatalog لتتمكن من الوصول إلى جميع جداول Iceberg/Delta لديك من خلال دالة واحدة. أمّا قسمَا دالة الجدول ومحرك الجدول أدناه فهما الأنسب للاستعلامات المخصّصة أو عندما تعرف path تخزينًا محددًا ولا تستخدم كتالوجًا.
1
استعلم عن بيانات Iceberg مباشرة
أسرع طريقة للبدء — خاصةً للاستعلامات المخصّصة أو عندما لا تستخدم كتالوجًا — هي استخدام دالة الجدول نفّذ استعلامًا:يقرأ ClickHouse البيانات الوصفية لـ Iceberg مباشرةً من S3 ويستنتج المخطط تلقائيًا. وينطبق النهج نفسه على
icebergS3(). وجّهها إلى جدول Iceberg في S3 ونفّذ استعلامًا فورًا، من دون أي إعداد.افحص المخطط:deltaLake() وhudi() وpaimon().تعرّف على المزيد: يتناول الاستعلام عن تنسيقات الجداول المفتوحة مباشرةً التنسيقات الأربعة، ومتغيرات cluster للقراءة الموزعة، وخيارات الواجهة الخلفية للتخزين (S3 وAzure وHDFS وlocal).2
أنشئ جدولًا دائمًا باستخدام محرك جدول Iceberg
عندما لا تستخدم كتالوجًا ولكنك ستنفّذ استعلامات على المسار نفسه بشكل متكرر، أنشئ جدولًا باستخدام محرك جدول Iceberg حتى لا تحتاج إلى تمرير المسار في كل مرة. تبقى البيانات في S3 — ولا تُنسخ أي بيانات:يمكنك الآن الاستعلام عنه كما تفعل مع أي جدول في ClickHouse:يدعم محرك الجدول التخزين المؤقت للبيانات، والتخزين المؤقت للبيانات الوصفية، وتطوّر المخطط، والسفر عبر الزمن. راجع دليل الاستعلام مباشرةً للحصول على تفاصيل حول ميزات محرك الجدول، ومصفوفة الدعم للاطلاع على مقارنة شاملة للميزات.
3
الاتصال بكتالوج
إذا كانت مؤسستك تستخدم كتالوج بيانات، فهذا هو مسار التكامل الذي نوصي به. تعمل الكتالوجات على تجميع البيانات الوصفية للجداول واكتشافها في مكان مركزي — وبدلًا من إدارة تعريف جدول لكل مسار تخزين، اتصل مرة واحدة باستخدام محرك قاعدة البيانات يتطلب كل نوع من أنواع الكتالوجات إعدادات اتصال خاصة به — راجع أدلة الكتالوجات للاطّلاع على القائمة الكاملة بالكتالوجات المدعومة وخيارات تهيئتها.تصفّح الجداول ونفّذ استعلامًا:تعرّف على المزيد: يشرح الاتصال بـ Data Catalog إعداد Unity Catalog كاملًا مع أمثلة على Delta وIceberg.
DataLakeCatalog. يظهر كل جدول في الكتالوج كجدول ClickHouse، بما في ذلك الجداول التي أُضيفت upstream بعد إنشاء الاتصال.إليك مثالاً على الاتصال بـ AWS Glue:علامات الاقتباس المعكوسة مطلوبة حول
<database>.<table> لأن ClickHouse لا يدعم بشكل أصلي أكثر من نطاق أسماء واحد.4
نفِّذ استعلامًا
بصرف النظر عن الطريقة التي استخدمتها أعلاه — دالة الجدول أو محرك الجدول أو صياغة الاستعلام متطابقة — والتغيير الوحيد يكون في عبارة
DataLakeCatalog — فإن ClickHouse SQL نفسه يعمل في جميعها. وفي بيئة الإنتاج عند استخدام كتالوج، نفِّذ الاستعلام عبر قاعدة البيانات DataLakeCatalog؛ وتظل الأمثلة الأخرى مفيدة للاختبارات السريعة والوصول المستند إلى path:FROM. تعمل جميع الدوال وعمليات JOIN وعمليات التجميع في ClickHouse SQL بالطريقة نفسها بغضّ النظر عن مصدر البيانات.5
حمّل مجموعة فرعية إلى ClickHouse
يُعد الاستعلام عن Iceberg مباشرةً أمرًا مناسبًا، لكن الأداء يظل محدودًا بمعدل نقل الشبكة وتخطيط الملفات. بالنسبة إلى أعباء العمل التحليلية، حمّل البيانات إلى جدول MergeTree أصلي.أولًا، شغّل استعلامًا مُرشَّحًا على جدول Iceberg للحصول على خط أساس:يفحص هذا الاستعلام مجموعة البيانات بالكامل في S3 لأن Iceberg لا يراعي عامل التصفية أعِد تنفيذ الاستعلام نفسه على جدول MergeTree:نظرًا لأن
counterid — لذا توقّع أن يستغرق ذلك عدة ثوانٍ.الآن أنشئ جدول MergeTree وحمّل البيانات:counterid هو العمود الأول في مفتاح ORDER BY، فإن الفهرس الأساسي المتناثر في ClickHouse يتخطّى مباشرةً إلى وحدات granule ذات الصلة، فلا يقرأ إلا الصفوف الخاصة بـ counterid = 38 بدلًا من فحص جميع الصفوف المئة مليون. والنتيجة هي تسارع كبير جدًا.يمضي دليل تسريع التحليلات إلى ما هو أبعد من ذلك باستخدام الأنواع LowCardinality، وفهارس النص الكامل، ومفاتيح ترتيب محسّنة، مع عرض تحسّن بنحو ~40x على مجموعة بيانات تضم 283 مليون صف.اعرف المزيد: يغطّي تسريع التحليلات باستخدام MergeTree تحسين المخطط، وفهرسة النص الكامل، ومقارنة كاملة للأداء قبل وبعد.6
الكتابة مرة أخرى إلى Iceberg
يمكن لـ ClickHouse أيضًا كتابة البيانات مرة أخرى إلى جداول Iceberg، مما يتيح سير عمل ETL العكسي — من خلال نشر النتائج المُجمَّعة أو مجموعات فرعية لتستخدمها أدوات أخرى (Spark وTrino وDuckDB وغيرها).أنشئ جدول Iceberg للمخرجات:اكتب النتائج المجمَّعة:يمكن لأي محرّك متوافق مع Iceberg قراءة جدول Iceberg الناتج.تعرّف على المزيد: يشرح كتابة البيانات إلى تنسيقات الجداول المفتوحة كيفية كتابة البيانات الخام والنتائج المجمّعة باستخدام مجموعة بيانات UK Price Paid، بما في ذلك اعتبارات المخطط عند مواءمة أنواع ClickHouse مع Iceberg.
الخطوات التالية
- الاتصال بالكتالوجات — موصى به لأعباء العمل المعتمدة على الكتالوج؛ جولة كاملة في Unity Catalog مع Delta وIceberg
- الاستعلام عن البيانات مباشرةً — التنسيقات الأربعة جميعها، خيارات العناقيد، محركات الجداول، التخزين المؤقت
- تسريع التحليلات — تحسين المخطط، الفهرسة، عرض توضيحي لزيادة السرعة بنحو 40x
- الكتابة إلى بحيرات البيانات — كتابة خام، كتابة مُجمّعة، مواءمة الأنواع
- مصفوفة الدعم — مقارنة الميزات عبر التنسيقات وأنظمة التخزين الخلفية
- أفضل الممارسات — اختيار أسلوب الوصول، وإعدادات الأداء، وأنماط أعباء العمل