کتاب Big Data Analytics with Hadoop and Spark

کتاب Big Data Analytics with Hadoop and Spark

اثر Shikha Mehta

category

بر اساس سطح علمی

متوسط

category

نوع محتوای کتاب

مبتنی بر پروژه

category

هدف یادگیری

تقویت مهارت‌های موجود

category

نوع مسیر

پروژه محور

category

بر اساس تکنولوژی

هدوپ (Hadoop)

category

مورد استفاده

مهندسی داده

شناسنامه کتاب

مشخصات تکمیلی ثبت‌شده برای این عنوان

نویسنده

Shikha Mehta

انتشارات

BPB Publications

سال انتشار

2026

فرمت کتاب

EPUB، PDF

تعداد صفحات

623

حجم فایل / وزن

10.24 مگابایت، 33.95 مگابایت

شابک (ISBN)

978-93-65894-745

ویرایش / نوبت چاپ

First

۱۴۰,۰۰۰ تومان

نظرات کاربران

تجربیات خود را از خواندن این کتاب با دیگران به اشتراک بگذارید.

—
امتیاز کل
star star star star star
از 0 نظر

ثبت نظر جدید

دیدگاهتان را بنویسید

هنوز دیدگاهی ثبت نشده است.

کتاب Big Data Analytics with Hadoop and Spark: A hands-on guide to big data engineering and scalable analytics (English Edition) (تحلیل کلان‌داده‌ها با Hadoop و Spark: راهنمای عملی مهندسی کلان‌داده و تحلیل‌های مقیاس‌پذیر) یک راهنمای عملی و گام‌به‌گام برای مهندسی کلان‌داده و تحلیل‌های مقیاس‌پذیر است که با استفاده از پلتفرم Cloudera، خواننده را با اکوسیستم کامل Hadoop و Spark آشنا می‌کند.

در ادامه مقدمه‌ای از کتاب Big Data Analytics with Hadoop and Spark را از زبان نویسنده شرح خواهیم داد.

مقدمه‌ای بر کتاب Big Data Analytics with Hadoop and Spark:

داده‌هایران (Big Data) به عنوان یک نیروی تحول‌آفرین در عصر دیجیتال ظاهر شده‌اند و سازمان‌ها را قادر می‌سازند تا بینش‌های معناداری را از مجموعه‌داده‌های عظیم، پیچیده و متنوع استخراج کنند. با رشد سریع داده‌های تولید شده از شبکه‌های اجتماعی، دستگاه‌های اینترنت اشیاء (IoT)، سیستم‌های سازمانی و تراکنش‌های آنلاین، تقاضا برای فضای ذخیره‌سازی مقیاس‌پذیر، چارچوب‌های پردازشی کارآمد و پلتفرم‌های تحلیلی پیشرفته روز به روز در حال افزایش است. این کتاب به گونه‌ای طراحی شده است که درکی جامع و عملی از تحلیل کلان‌داده‌ها ارائه دهد و هم مفاهیم پایه‌ای و هم پیاده‌سازی‌های عملی را با استفاده از هادوپ، اسپارک و ابزارهای اکوسیستم مرتبط در پلتفرم کلودرا (Cloudera) پوشش دهد.
کتاب Big Data Analytics with Hadoop and Spark رویکردی ساختاریافته و گام‌به‌گام را اتخاذ کرده است که با اصول بنیادین کلان‌داده‌ها آغاز شده و به تدریج به سمت پردازش پیشرفته داده‌ها، انبار داده‌ها، پایگاه‌های داده NoSQL و کاربردهای یادگیری ماشین در مقیاس بزرگ پیش می‌رود. خوانندگان از طریق مطالعات موردی دنیای واقعی، تمرین‌های عملی و نمایش‌های کاربردی، مهارت‌های مورد نیاز برای طراحی، پیاده‌سازی و تحلیل کارآمد راهکارهای کلان‌داده را کسب خواهند کرد.

فهرست مطالب کتاب Big Data Analytics with Hadoop and Spark

  • فصل ۱: کاوش در کلان‌داده – این فصل مفاهیم بنیادین کلان‌داده‌ها شامل ویژگی‌ها، تکامل و اهمیت آن‌ها در صنایع مختلف را معرفی می‌کند. همچنین معماری‌های کلان‌داده، پلتفرم‌ها و اجزای فناوری را بررسی کرده و محرک‌های کلیدی برای پذیرش آن‌ها را برجسته می‌سازد. علاوه بر این، دغدغه‌های حیاتی مانند امنیت، انطباق، ممیزی، حریم خصوصی و اخلاق در سیستم‌های کلان‌داده مورد بحث قرار می‌گیرد.
  • فصل ۲: مقدمه‌ای بر هادوپ – این فصل از کتاب Big Data Analytics with Hadoop and Spark چالش‌های ذخیره‌سازی و پردازش ناشی از کلان‌داده‌ها را بررسی کرده و هادوپ را به عنوان یک راهکار معرفی می‌کند. ریشه‌ها، معماری و مزایای هادوپ را شرح داده و آن را با سیستم‌های مدیریت پایگاه داده رابطه‌ای (RDBMS) سنتی و پایگاه‌های داده توزیع‌شده مقایسه می‌کند. همچنین اکوسیستم هادوپ را از طریق یک مطالعه موردی عملی در زمینه تحلیل داده‌های سهام توضیح می‌دهد.
  • فصل ۳: سیستم فایل توزیع‌شده هادوپ و MapReduce – این فصل سیستم‌های فایل سنتی و توزیع‌شده را توضیح داده و بر نیاز به HDFS تأکید می‌کند. معماری و ویژگی‌های HDFS را با جزئیات بررسی کرده و MapReduce را به عنوان مدل پردازشی هادوپ معرفی می‌کند. مفاهیمی مانند جفت‌های کلید-مقدار، مراحل نگاشت و کاهش (Map and Reduce)، در هم ریختگی (Shuffling) و جریان منطقی داده‌ها از طریق یک مطالعه موردی تحلیل داده‌های آب و هوا تشریح می‌شوند.
  • فصل ۴: تحلیل کلان‌داده با کلودرا – این فصل از کتاب Big Data Analytics with Hadoop and Spark آشنایی عملی با توزیع‌های تجاری هادوپ با تمرکز بر چارچوب کلودرا را فراهم می‌کند. خوانندگان را در زمینه نصب و پیکربندی ماشین مجازی QuickStart کلودرا راهنمایی کرده و دستورات پایه HDFS را برای کار در محیط هادوپ معرفی می‌کند.
  • فصل ۵: تحلیل داده‌های سهام با استفاده از کلودرا – این فصل تحلیل سرتاسری داده‌های بازار سهام را با استفاده از هادوپ و کلودرا نشان می‌دهد. این فصل ورود داده‌ها به HDFS، اجرای جاب‌ های هادوپ و توسعه برنامه‌های MapReduce به زبان جاوا برای تحلیل داده‌های بازار سهام را پوشش می‌دهد.
  • فصل ۶: درک Pig برای پردازش کلان‌داده – این فصل از کتاب Big Data Analytics with Hadoop and Spark آپاچی پیگ (Apache Pig) را به عنوان یک پلتفرم پردازش داده سطح بالا برای هادوپ معرفی می‌کند. معماری Pig، حالت‌های اجرا، نحوه نگارش (Syntax) زبان Pig Latin، مدل‌های داده، عملگرها و توابع تعریف‌شده توسط کاربر (UDF) را به همراه اجرای عملی در محیط کلودرا توضیح می‌دهد.
  • فصل ۷: عملگرها در Pig Latin – این فصل بر توسعه کاربردی با استفاده از عملگرهای Pig Latin تمرکز دارد. خوانندگان یاد می‌گیرند که چگونه با استفاده از Pig داده‌ها را بارگذاری، فیلتر، گروه‌بندی، پیوند (Join)، مرتب‌سازی، تفکیک و ترکیب کنند که این امر پردازش کارآمد مجموعه‌داده‌های بزرگ را امکان‌پذیر می‌سازد.
  • فصل ۸: توابع در آپاچی Pig – این فصل از کتاب Big Data Analytics with Hadoop and Spark توابع داخلی و تعریف‌شده توسط کاربر (UDF) را در Pig بررسی می‌کند. توابع رشته‌ای، توسعه UDF و تحلیل داده‌های بازار سهام در دنیای واقعی با استفاده از Pig را به نمایش می‌گذارد و بر منطق تحول داده‌های قابل استفاده مجدد و توسعه‌پذیر تأکید می‌کند.
  • فصل ۹: انبار داده‌های Hive و پرس‌وجوهای SQL-مانند – این فصل آپاچی هایو (Apache Hive) را به عنوان یک راهکار انبار داده روی هادوپ معرفی می‌کند. مدل داده هایو، معماری، زبان HiveQL، عملیات DDL و DML، ساختارهای SerDes را توضیح داده و هایو را با Pig و سیستم‌های سنتی مبتنی بر SQL مقایسه می‌کند.
  • فصل ۱۰: تحلیل داده با استفاده از Hive – این فصل تجربه عملی با Hive را فراهم می‌کند و مواردی چون ایجاد جدول، بارگذاری داده‌ها، پرس‌وجو، پارتیشن‌بندی، خوشه‌بندی، تجمیع (Aggregation)، گروه‌بندی و پیوندها را پوشش می‌دهد. تمرکز این فصل بر کارهای تحلیل عملی داده با استفاده از HiveQL در کلودرا است.
  • فصل ۱۱: ذخیره‌سازی و پردازش داده با استفاده از HBase – این فصل HBase را به عنوان یک پایگاه داده NoSQL ستون‌گرا برای تحلیل کلان‌داده معرفی می‌کند. معماری HBase، مدل ذخیره‌سازی داده و دستورات Shell را توضیح داده و طراحی و توسعه یک برنامه بازار سهام را با استفاده از HBase به نمایش می‌گذارد.
  • فصل ۱۲: MongoDB – این فصل از کتاب Big Data Analytics with Hadoop and Spark پایگاه‌های داده NoSQL و قضیه CAP را معرفی می‌کند و به دنبال آن بررسی عمیقی از MongoDB ارائه می‌دهد. مدل داده MongoDB، عملیات CRUD، عملگرهای تجمیع و توسعه برنامه‌ها با استفاده از مثال‌های دنیای واقعی را پوشش می‌دهد.
  • فصل ۱۳: مقدمه‌ای بر Spark برای پردازش کلان‌داده – این فصل آپاچی اسپارک (Apache Spark) را به عنوان یک چارچوب محاسباتی توزیع‌شده سریع و درون حافظه‌ای (In-memory) معرفی می‌کند. معماری اسپارک، مقایسه اسپارک و هادوپ، مفاهیم برنامه‌های اسپارک، مجموعه‌داده‌های توزیع‌شده مقاوم (RDD)، دیتافریم‌ها، تبدیل‌ها (Transformations)، اقدامات (Actions) و ارزیابی تنبل (Lazy Evaluation) را از طریق مثال‌های عملی پوشش می‌دهد.
  • فصل ۱۴: شروع به کار با برنامه‌نویسی اسکالا – این فصل از کتاب Big Data Analytics with Hadoop and Spark اصول برنامه‌نویسی اسکالا (Scala) را که برای توسعه اسپارک مورد نیاز است، معرفی می‌کند. انواعی از داده‌ها، عملگرها، ساختارهای کنترلی، توابع، کلاس‌ها، وراثت و اجرای برنامه‌های اسکالا در محیط کلودرا را پوشش می‌دهد.
  • فصل ۱۵: تحلیل داده با Spark SQL – این فصل از کتاب Big Data Analytics with Hadoop and Spark اسپارک SQL و پردازش داده‌های ساختاریافته را با استفاده از دیتافریم‌ها و مجموعه‌داده‌ها توضیح می‌دهد. معماری Spark SQL، ورود داده از چندین فرمت، عملیات دیتافریم و توسعه برنامه‌های سرتاسری با استفاده از Spark SQL را پوشش می‌دهد.
  • فصل ۱۶: کاربرد یادگیری ماشین با استفاده از PySpark – این فصل مفاهیم یادگیری ماشین را معرفی کرده و توضیح می‌دهد که چرا اسپارک برای برنامه‌های یادگیری ماشین در مقیاس بزرگ مناسب است. دسته‌بندی (Classification) و خوشه‌بندی (Clustering) را با استفاده از خطوط لوله (Pipelines) یادگیری ماشین اسپارک به نمایش می‌گذارد و آماده‌سازی داده‌ها، آموزش مدل، ارزیابی و پیش‌بینی را با استفاده از PySpark پوشش می‌دهد.

سرفصل‌های کتاب Big Data Analytics with Hadoop and Spark:

  • Cover
  • Title Page
  • Copyright Page
  • Dedication Page
  • About the Author
  • About the Reviewers
  • Acknowledgement
  • Preface
  • Table of Contents
  • 1. Exploring Big Data
  • 2. Introduction to Hadoop
  • 3. Hadoop Distributed File System and MapReduce
  • 4. Big Data Analysis with Cloudera
  • 5. Stock Data Analysis with Cloudera
  • 6. Understanding Pig for Big Data Processing
  • 7. Operators in Pig Latin
  • 8. Functions in Apache Pig
  • 9. Hive-data Warehousing and SQL-like Queries
  • 10. Data Analysis Using Hive
  • 11. Data Storage and Processing Using HBase
  • 12. MongoDB
  • 13. Introduction to Spark for Big Data Processing
  • 14. Getting Started with Scala Programming
  • 15. Data Analysis with Spark SQL
  • 16. Machine Learning Application Using PySpark
  • Index

جهت دانلود کتاب Big Data Analytics with Hadoop and Spark می‌توانید پس از پرداخت، دریافت کنید.