۲۰۲۴
کتاب Engineering Lakehouses with Open Table Formats
اثر Dipankar Mazumdar, Vinoth Govindarajan
نوع محتوای کتاب
آموزش گام به گام
هدف یادگیری
ارتقای شغلی
نوع مسیر
مرجع / کتابچه راهنما
بر اساس تکنولوژی
علوم داده
بر اساس سطح علمی
پیشرفته
شناسنامه کتاب
مشخصات تکمیلی ثبتشده برای این عنوان
نویسنده
Dipankar Mazumdar, Vinoth Govindarajan
انتشارات
Packt
سال انتشار
2025
فرمت کتاب
تعداد صفحات
414
حجم فایل / وزن
7.11 مگابایت, 8.03 مگابایت
شابک (ISBN)
978-1-83620-723-8
ویرایش / نوبت چاپ
First
مجموعه کتاب آموزش مهندسی داده (Data Engineering)
مهندسی داده دیگر یک مهارت جانبی نیست — یک رشتهی تخصصی با مسیر یادگیری مشخص است. بازار کار امروز بین «کسی که با داده کار میکند» و «مهندس دادهای که pipeline طراحی میکند» فرق واضحی میگذارد. اولی داده را تحلیل میکند؛ دومی زیرساختی میسازد که داده بتواند جریان داشته باشد، پاکسازی شود، ذخیره شود و در مقیاس بزرگ پردازش شود. این باندل برای رسیدن به دومی طراحی شده. این باندل برای کیست؟ اگر یکی از این جملات شما را توصیف میکند، این باندل برای شماست: دانشجوی کارشناسی یا ارشد علوم کامپیوتر که میخواهد مسیر Data Engineering را جدی بگیرد توسعهدهندهای که میخواهد از backend به دنیای دادههای بزرگ وارد شود دادهکاوی که یاد گرفته مدل بسازد اما pipeline ندارد متخصصی که برای آزمونهای Databricks، Google Cloud Professional Data Engineer یا AWS Data Engineer آماده میشود این باندل برای کی نیست؟ اگر هنوز با Python و SQL راحت نیستید، پیشنهاد میکنیم ابتدا مبانی را تقویت کنید — این کتابها پیشفرض میگیرند که با زبان برنامهنویسی آشنایی دارید. کتابهای این باندل و ترتیب پیشنهادی مطالعه: مرحله ۱ — پایه: معماری سیستمهای داده بزرگ کتاب Hadoop: The Definitive Guide پایهایترین مرجع اکوسیستم Big Data است. MapReduce، YARN، HDFS و Spark در این کتاب از صفر توضیح داده میشوند. حتی اگر هرگز مستقیم با Hadoop کار نکنید، درک معماری آن برای فهمیدن بقیهی ابزارها ضروری است. مرحله ۲ — Pipeline: ساختن جریان داده کتاب Kafka: The Definitive Guide استاندارد صنعتی برای یادگیری Apache Kafka است — سیستم پیامرسانی توزیعشدهای که در قلب اکثر pipeline های real-time قرار دارد. نسخه دوم این کتاب شامل Exactly-Once Semantics و Stream Processing است که در کارهای عملی حیاتیاند. مرحله ۳ — پردازش: Spark و PySpark کتابهای Data Engineering with Apache Spark, Delta Lake and Lakehouse و Essential PySpark for Scalable Data Analytics با هم کاملترین پوشش Apache Spark را میدهند. اولی روی معماری Lakehouse و Azure تمرکز دارد؛ دومی رویکرد Python-محور دارد و برای کسانی که با pandas آشنایند طبیعیتر است. مرحله ۴ — ذخیرهسازی: Data Lake طراحی کن کتاب The Enterprise Big Data Lake و Architecting Modern Data Platforms هر دو به معماری سطح سازمانی میپردازند. تفاوت: اولی بیشتر روی governance و strategy است؛ دومی روی stack فنی (Hive، Impala، Spark، Kafka) عمیقتر است. مرحله ۵ — استقرار: داده روی Kubernetes کتاب Big Data on Kubernetes جدیدترین کتاب این باندل (۲۰۲۴) است و نشان میدهد چطور Spark، Airflow و Kafka را روی یک خوشهی Kubernetes راهاندازی کنید — مهارتی که در شرکتهای ابری سطح بالا الزامی شده. چرا این کتابها را به زبان اصلی بخوانید؟ اصطلاحاتی مثل data lineage، schema evolution، partitioning strategy، watermarking و late-arriving data در هیچ ترجمهی فارسی معادل دقیقی ندارند. وقتی در یک تیم بینالمللی کار میکنید یا مستندات Apache را میخوانید، همین واژهها هستند که باید بلد باشید — نه ترجمهشان.
کتابهای پیشنهادی این تخصص:
نظرات کاربران
تجربیات خود را از خواندن این کتاب با دیگران به اشتراک بگذارید.
ثبت نظر جدید
هنوز دیدگاهی ثبت نشده است.
کتاب Engineering Lakehouses with Open Table Formats: Build scalable and efficient lakehouses with Apache Iceberg, Apache Hudi, and Delta Lake (مهندسی لیکهاوسها با فرمتهای جدول باز: ساخت لیکهاوسهای مقیاسپذیر و کارآمد با Apache Iceberg، Apache Hudi و Delta Lake) به بررسی معماری و پیادهسازی لیکهاوسها با تمرکز بر فرمتهای جدول باز میپردازد و نشان میدهد چگونه میتوان با استفاده از Apache Iceberg، Apache Hudi و Delta Lake سیستمهای دادهای مقیاسپذیر، قابلاعتماد و کارآمد ساخت.
در ادامه مقدمهای از کتاب Engineering Lakehouses with Open Table Formats را از زبان نویسنده شرح خواهیم داد.
مقدمهای بر کتاب Engineering Lakehouses with Open Table Formats:
ظهور معماری لیکهاوس داده نحوه مدیریت، پردازش و تحلیل دادهها در سازمانها را بازتعریف کرده است. با بلوغ تدریجی استانداردهای باز، مهندسی داده مدرن بیش از پیش به دستهای جدید از فناوریها به نام فرمتهای جدول باز مانند Apache Iceberg، Apache Hudi و Delta Lake متکی شده است تا سازگاری تراکنشی، کارایی و انعطافپذیری را به دریاچههای داده اضافه کند.
کتاب Engineering Lakehouses with Open Table Formats با هدف کمک به مهندسان و معماران داده برای درک، ارزیابی و پیادهسازی این فرمتها در محیطهای واقعی نوشته شده است. این کتاب کل مسیر ساخت لیکهاوس را پوشش میدهد؛ از درک جزئیات داخلی فرمتهای جدول و قابلیتهای تراکنشی گرفته تا ساخت لیکهاوسهای آماده تولید با استفاده از ابزارهایی مانند Apache Spark، Flink، Kafka، Debezium، MLflow و فریمورکهای پایتون. رویکرد کتاب کاملاً عملی و مهندسیمحور است و در سراسر آن از مثالها، دیاگرامهای معماری و دستورالعملهای کدنویسی استفاده شده است.
کتاب Engineering Lakehouses with Open Table Formats برای چه کسانی مناسب است
این کتاب برای مهندسان داده و نرمافزار، معماران سیستم و مهندسان پلتفرم که در حال ساخت یا نوسازی پلتفرمهای داده در محیطهای ابری یا درونسازمانی هستند، نوشته شده است. داشتن درک پایهای از سیستمهای توزیعشده، معماریهای داده (مانند انبار داده و دریاچه داده)، SQL و پایتون به بهرهگیری بهتر از مطالب کتاب کمک میکند. آشنایی با ابزارهایی مانند Apache Spark یا Flink مزیت محسوب میشود، اما الزامی نیست. تمامی مفاهیم بهصورت گامبهگام و کاربردی توضیح داده شدهاند.
محتوای کتاب Engineering Lakehouses with Open Table Formats
فصل ۱: لیکهاوس داده باز؛ یک پارادایم معماری جدید
به بررسی تکامل معماریهای داده میپردازد و توضیح میدهد چگونه لیکهاوس انعطافپذیری دریاچههای داده را با قابلیت اطمینان انبارهای داده ترکیب میکند.
فصل ۲: قابلیتهای تراکنشی لیکهاوس
بررسی تراکنشهای ACID، کنترل همزمانی و سرویسهای مدیریت جدول که پایداری پردازش داده در مقیاس بزرگ را تضمین میکنند و نحوه پیادهسازی آنها در هر فرمت.
فصل ۳: بررسی عمیق Apache Iceberg
معماری Iceberg، لایههای متادیتا، manifest listها، یکپارچگی با کاتالوگها و قابلیتهایی مانند پارتیشنبندی پنهان، شاخهبندی و آمار پیشرفته را پوشش میدهد و مثالهای عملی متعددی ارائه میکند.
فصل ۴: بررسی عمیق Apache Hudi
اصول طراحی اصلی Hudi شامل مدیریت timeline، ساختار file group، ایندکسگذاری و پردازش افزایشی داده را توضیح میدهد و اجرای تراکنشها در مقیاس بزرگ را با مثالهای عملی نشان میدهد.

فصل ۵: بررسی عمیق Delta Lake
لاگ تراکنش Delta، اعمال اسکیما و نسخهبندی داده را تشریح میکند و با مثالهای کدنویسی، استفاده از Delta در تحلیل بلادرنگ و بارهای کاری یادگیری ماشین را نشان میدهد.
فصل ۶: مدیریت کاتالوگ و متادیتا
بررسی نقش کاتالوگها در کشف داده، تکامل اسکیما و کنترل نسخه در موتورها و محیطهای مختلف.
فصل ۷: قابلیت همکاری در لیکهاوسها
اهمیت سازگاری بین فرمتها را بررسی میکند و ابزارهایی مانند Apache XTable و Delta UniForm را بهعنوان پلهایی برای همکاری چندفرمتی معرفی میکند.
فصل ۸: بهینهسازی و تنظیم عملکرد در لیکهاوس
تکنیکهایی مانند پارتیشنبندی، خوشهبندی، فشردهسازی (compaction) و ایندکسگذاری برای بهبود کارایی کوئریها، کاهش هزینه و کاهش تأخیر را بررسی میکند.

فصل ۹: حاکمیت داده و امنیت در لیکهاوسها
راهبردهای پیادهسازی کنترل دسترسی دقیق، ممیزی و انطباق با الزامات قانونی را توضیح میدهد.
فصل ۱۰: ارزیابی و انتخاب فرمتهای جدول باز
راهنمایی برای انتخاب بین Iceberg، Hudi و Delta بر اساس نوع بار کاری (batch، streaming یا incremental) ارائه میدهد و یک چارچوب تصمیمگیری برای مهندسان و معماران پیشنهاد میکند.
فصل ۱۱: کاربردهای واقعی و تجربیات عملی
با ارائه پیادهسازیهای واقعی از بارهای کاری تحلیلی، CDC و یادگیری ماشین، و یکپارچهسازی فرمتهای جدول باز با ابزارهای orchestration و BI، مطالب کتاب را جمعبندی میکند.

سرفصلهای کتاب Engineering Lakehouses with Open Table Formats:
- Cover
- Title Page
- Table of Contents
- Preface
- Chapter 1: Open Data Lakehouse: A New Architectural Paradigm
- Chapter 2: Transactional Capabilities of the Lakehouse
- Chapter 3: Apache Iceberg Deep Dive
- Chapter 4: Apache Hudi Deep Dive
- Chapter 5: Delta Lake Deep Dive
- Chapter 6: Catalog and Metadata Management
- Chapter 7: Interoperability in Lakehouses
- Chapter 8: Performance Optimization and Tuning in a Lakehouse
- Chapter 9: Data Governance and Security in Lakehouses
- Chapter 10: Evaluating and Selecting Open Table Formats
- Chapter 11: Real-World Applications and Learnings
- Chapter 12: Unlock Your Exclusive Benefits
- About Packt
- Other Books You May Enjoy
- Index
جهت دانلود کتاب Engineering Lakehouses with Open Table Formats میتوانید پس از پرداخت، دریافت کنید.
