کتاب Big Data Analytics with Hadoop and Spark
اثر Shikha Mehta
بر اساس سطح علمی
متوسط
نوع محتوای کتاب
مبتنی بر پروژه
هدف یادگیری
تقویت مهارتهای موجود
نوع مسیر
پروژه محور
بر اساس تکنولوژی
هدوپ (Hadoop)
مورد استفاده
مهندسی داده
شناسنامه کتاب
مشخصات تکمیلی ثبتشده برای این عنوان
نویسنده
Shikha Mehta
انتشارات
BPB Publications
سال انتشار
2026
فرمت کتاب
EPUB، PDF
تعداد صفحات
623
حجم فایل / وزن
10.24 مگابایت، 33.95 مگابایت
شابک (ISBN)
978-93-65894-745
ویرایش / نوبت چاپ
First
کتابهای پیشنهادی این تخصص:
نظرات کاربران
تجربیات خود را از خواندن این کتاب با دیگران به اشتراک بگذارید.
ثبت نظر جدید
هنوز دیدگاهی ثبت نشده است.
کتاب Big Data Analytics with Hadoop and Spark: A hands-on guide to big data engineering and scalable analytics (English Edition) (تحلیل کلاندادهها با Hadoop و Spark: راهنمای عملی مهندسی کلانداده و تحلیلهای مقیاسپذیر) یک راهنمای عملی و گامبهگام برای مهندسی کلانداده و تحلیلهای مقیاسپذیر است که با استفاده از پلتفرم Cloudera، خواننده را با اکوسیستم کامل Hadoop و Spark آشنا میکند.
در ادامه مقدمهای از کتاب Big Data Analytics with Hadoop and Spark را از زبان نویسنده شرح خواهیم داد.
مقدمهای بر کتاب Big Data Analytics with Hadoop and Spark:
فهرست مطالب کتاب Big Data Analytics with Hadoop and Spark
-
فصل ۱: کاوش در کلانداده – این فصل مفاهیم بنیادین کلاندادهها شامل ویژگیها، تکامل و اهمیت آنها در صنایع مختلف را معرفی میکند. همچنین معماریهای کلانداده، پلتفرمها و اجزای فناوری را بررسی کرده و محرکهای کلیدی برای پذیرش آنها را برجسته میسازد. علاوه بر این، دغدغههای حیاتی مانند امنیت، انطباق، ممیزی، حریم خصوصی و اخلاق در سیستمهای کلانداده مورد بحث قرار میگیرد.
-
فصل ۲: مقدمهای بر هادوپ – این فصل از کتاب Big Data Analytics with Hadoop and Spark چالشهای ذخیرهسازی و پردازش ناشی از کلاندادهها را بررسی کرده و هادوپ را به عنوان یک راهکار معرفی میکند. ریشهها، معماری و مزایای هادوپ را شرح داده و آن را با سیستمهای مدیریت پایگاه داده رابطهای (RDBMS) سنتی و پایگاههای داده توزیعشده مقایسه میکند. همچنین اکوسیستم هادوپ را از طریق یک مطالعه موردی عملی در زمینه تحلیل دادههای سهام توضیح میدهد.
-
فصل ۳: سیستم فایل توزیعشده هادوپ و MapReduce – این فصل سیستمهای فایل سنتی و توزیعشده را توضیح داده و بر نیاز به HDFS تأکید میکند. معماری و ویژگیهای HDFS را با جزئیات بررسی کرده و MapReduce را به عنوان مدل پردازشی هادوپ معرفی میکند. مفاهیمی مانند جفتهای کلید-مقدار، مراحل نگاشت و کاهش (Map and Reduce)، در هم ریختگی (Shuffling) و جریان منطقی دادهها از طریق یک مطالعه موردی تحلیل دادههای آب و هوا تشریح میشوند.
-
فصل ۴: تحلیل کلانداده با کلودرا – این فصل از کتاب Big Data Analytics with Hadoop and Spark آشنایی عملی با توزیعهای تجاری هادوپ با تمرکز بر چارچوب کلودرا را فراهم میکند. خوانندگان را در زمینه نصب و پیکربندی ماشین مجازی QuickStart کلودرا راهنمایی کرده و دستورات پایه HDFS را برای کار در محیط هادوپ معرفی میکند.
-
فصل ۵: تحلیل دادههای سهام با استفاده از کلودرا – این فصل تحلیل سرتاسری دادههای بازار سهام را با استفاده از هادوپ و کلودرا نشان میدهد. این فصل ورود دادهها به HDFS، اجرای جاب های هادوپ و توسعه برنامههای MapReduce به زبان جاوا برای تحلیل دادههای بازار سهام را پوشش میدهد.
-
فصل ۶: درک Pig برای پردازش کلانداده – این فصل از کتاب Big Data Analytics with Hadoop and Spark آپاچی پیگ (Apache Pig) را به عنوان یک پلتفرم پردازش داده سطح بالا برای هادوپ معرفی میکند. معماری Pig، حالتهای اجرا، نحوه نگارش (Syntax) زبان Pig Latin، مدلهای داده، عملگرها و توابع تعریفشده توسط کاربر (UDF) را به همراه اجرای عملی در محیط کلودرا توضیح میدهد.
-
فصل ۷: عملگرها در Pig Latin – این فصل بر توسعه کاربردی با استفاده از عملگرهای Pig Latin تمرکز دارد. خوانندگان یاد میگیرند که چگونه با استفاده از Pig دادهها را بارگذاری، فیلتر، گروهبندی، پیوند (Join)، مرتبسازی، تفکیک و ترکیب کنند که این امر پردازش کارآمد مجموعهدادههای بزرگ را امکانپذیر میسازد.
-
فصل ۸: توابع در آپاچی Pig – این فصل از کتاب Big Data Analytics with Hadoop and Spark توابع داخلی و تعریفشده توسط کاربر (UDF) را در Pig بررسی میکند. توابع رشتهای، توسعه UDF و تحلیل دادههای بازار سهام در دنیای واقعی با استفاده از Pig را به نمایش میگذارد و بر منطق تحول دادههای قابل استفاده مجدد و توسعهپذیر تأکید میکند.
-
فصل ۹: انبار دادههای Hive و پرسوجوهای SQL-مانند – این فصل آپاچی هایو (Apache Hive) را به عنوان یک راهکار انبار داده روی هادوپ معرفی میکند. مدل داده هایو، معماری، زبان HiveQL، عملیات DDL و DML، ساختارهای SerDes را توضیح داده و هایو را با Pig و سیستمهای سنتی مبتنی بر SQL مقایسه میکند.
-
فصل ۱۰: تحلیل داده با استفاده از Hive – این فصل تجربه عملی با Hive را فراهم میکند و مواردی چون ایجاد جدول، بارگذاری دادهها، پرسوجو، پارتیشنبندی، خوشهبندی، تجمیع (Aggregation)، گروهبندی و پیوندها را پوشش میدهد. تمرکز این فصل بر کارهای تحلیل عملی داده با استفاده از HiveQL در کلودرا است.
-
فصل ۱۱: ذخیرهسازی و پردازش داده با استفاده از HBase – این فصل HBase را به عنوان یک پایگاه داده NoSQL ستونگرا برای تحلیل کلانداده معرفی میکند. معماری HBase، مدل ذخیرهسازی داده و دستورات Shell را توضیح داده و طراحی و توسعه یک برنامه بازار سهام را با استفاده از HBase به نمایش میگذارد.
-
فصل ۱۲: MongoDB – این فصل از کتاب Big Data Analytics with Hadoop and Spark پایگاههای داده NoSQL و قضیه CAP را معرفی میکند و به دنبال آن بررسی عمیقی از MongoDB ارائه میدهد. مدل داده MongoDB، عملیات CRUD، عملگرهای تجمیع و توسعه برنامهها با استفاده از مثالهای دنیای واقعی را پوشش میدهد.
-
فصل ۱۳: مقدمهای بر Spark برای پردازش کلانداده – این فصل آپاچی اسپارک (Apache Spark) را به عنوان یک چارچوب محاسباتی توزیعشده سریع و درون حافظهای (In-memory) معرفی میکند. معماری اسپارک، مقایسه اسپارک و هادوپ، مفاهیم برنامههای اسپارک، مجموعهدادههای توزیعشده مقاوم (RDD)، دیتافریمها، تبدیلها (Transformations)، اقدامات (Actions) و ارزیابی تنبل (Lazy Evaluation) را از طریق مثالهای عملی پوشش میدهد.
-
فصل ۱۴: شروع به کار با برنامهنویسی اسکالا – این فصل از کتاب Big Data Analytics with Hadoop and Spark اصول برنامهنویسی اسکالا (Scala) را که برای توسعه اسپارک مورد نیاز است، معرفی میکند. انواعی از دادهها، عملگرها، ساختارهای کنترلی، توابع، کلاسها، وراثت و اجرای برنامههای اسکالا در محیط کلودرا را پوشش میدهد.
-
فصل ۱۵: تحلیل داده با Spark SQL – این فصل از کتاب Big Data Analytics with Hadoop and Spark اسپارک SQL و پردازش دادههای ساختاریافته را با استفاده از دیتافریمها و مجموعهدادهها توضیح میدهد. معماری Spark SQL، ورود داده از چندین فرمت، عملیات دیتافریم و توسعه برنامههای سرتاسری با استفاده از Spark SQL را پوشش میدهد.
-
فصل ۱۶: کاربرد یادگیری ماشین با استفاده از PySpark – این فصل مفاهیم یادگیری ماشین را معرفی کرده و توضیح میدهد که چرا اسپارک برای برنامههای یادگیری ماشین در مقیاس بزرگ مناسب است. دستهبندی (Classification) و خوشهبندی (Clustering) را با استفاده از خطوط لوله (Pipelines) یادگیری ماشین اسپارک به نمایش میگذارد و آمادهسازی دادهها، آموزش مدل، ارزیابی و پیشبینی را با استفاده از PySpark پوشش میدهد.
سرفصلهای کتاب Big Data Analytics with Hadoop and Spark:
- Cover
- Title Page
- Copyright Page
- Dedication Page
- About the Author
- About the Reviewers
- Acknowledgement
- Preface
- Table of Contents
- 1. Exploring Big Data
- 2. Introduction to Hadoop
- 3. Hadoop Distributed File System and MapReduce
- 4. Big Data Analysis with Cloudera
- 5. Stock Data Analysis with Cloudera
- 6. Understanding Pig for Big Data Processing
- 7. Operators in Pig Latin
- 8. Functions in Apache Pig
- 9. Hive-data Warehousing and SQL-like Queries
- 10. Data Analysis Using Hive
- 11. Data Storage and Processing Using HBase
- 12. MongoDB
- 13. Introduction to Spark for Big Data Processing
- 14. Getting Started with Scala Programming
- 15. Data Analysis with Spark SQL
- 16. Machine Learning Application Using PySpark
- Index
جهت دانلود کتاب Big Data Analytics with Hadoop and Spark میتوانید پس از پرداخت، دریافت کنید.
