کتاب Reinforcement Learning from Human Feedback

کتاب Reinforcement Learning from Human Feedback

اثر Nathan Lambert

category

نوع محتوای کتاب

راهنمای مرجع

category

هدف یادگیری

ارتقای شغلی

category

نوع مسیر

مرجع / کتابچه راهنما

category

بر اساس تکنولوژی

یادگیری ماشین

category

مورد استفاده

هوش مصنوعی / یادگیری ماشین

info نکات مهم قبل از خرید:

  • نسخه کتاب فعلی به زبان لاتین می‌باشد.
  • کتاب به صورت محصول می‌باشد و پس از خرید بلافاصله در دسترس شما قرار می‌گیرد.
  • قبل از خرید، قسمت توضیحات تکمیلی مربوط به هر کتاب را مطالعه کنید.
  • در صورت هرگونه سؤال با ایمیل و یا شماره پشتیبانی سایت در تماس باشید.
  • درگاه پرداخت رمزارز نیز برای هموطنان خارج از کشور فعال است.

درباره این کتاب

کتاب Reinforcement Learning from Human Feedback: LLM alignment and post-training (یادگیری تقویتی از بازخورد انسانی: هم‌راستاسازی و پسا-آموزش مدل‌های زبانی بزرگ) نوشته‌ی نیتن لمبرت (محقق برجستهٔ هوش مصنوعی و مسئول بخش پسا-آموزش در مؤسسهٔ آلن برای هوش مصنوعی)، یک راهنمای عملی و متمرکز برای درک و پیاده‌سازی روش‌های هم‌راستاسازی و پسا-آموزش مدل‌های زبانی بزرگ است. این کتاب با پرهیز از پرداختن به تمام جوانب گستردهٔ یادگیری تقویتی، مستقیماً به سراغ…

۱۴۰,۰۰۰ تومان

کتاب‌های پیشنهادی این دسته‌بندی:

نظرات کاربران

تجربیات خود را از خواندن این کتاب با دیگران به اشتراک بگذارید.

امتیاز کل
star star star star star
از 0 نظر

ثبت نظر جدید

دیدگاهتان را بنویسید

هنوز دیدگاهی ثبت نشده است.

کتاب Reinforcement Learning from Human Feedback: LLM alignment and post-training (یادگیری تقویتی از بازخورد انسانی: هم‌راستاسازی و پسا-آموزش مدل‌های زبانی بزرگ) نوشته‌ی نیتن لمبرت (محقق برجستهٔ هوش مصنوعی و مسئول بخش پسا-آموزش در مؤسسهٔ آلن برای هوش مصنوعی)، یک راهنمای عملی و متمرکز برای درک و پیاده‌سازی روش‌های هم‌راستاسازی و پسا-آموزش مدل‌های زبانی بزرگ است.

این کتاب با پرهیز از پرداختن به تمام جوانب گستردهٔ یادگیری تقویتی، مستقیماً به سراغ فرآیند RLHF می‌رود و در فصل‌های کوتاه خود، مراحل کلیدی از جمله تنظیم دقیق دستوری (Instruction Fine-tuning)، ساخت مدل‌های پاداش قابل اعتماد، الگوریتم‌های بهینه‌سازی خط‌ مشی (مانند PPO)، بهینه‌سازی مستقیم ترجیحات (DPO)، و همچنین چالش‌های دنیای واقعی مانند جمع‌آوری داده‌های ترجیحی، تولید داده‌های مصنوعی و صدا‌زنی تابع (Function Calling) را پوشش می‌دهد.

در ادامه مقدمه‌ای از کتاب Reinforcement Learning from Human Feedback را شرح خواهیم داد.

مقدمه‌ای بر کتاب Reinforcement Learning from Human Feedback:

نویسنده در دوران تحصیلات تکمیلی خود در دانشگاه برکلی (UC Berkeley) و در تابستان ۲۰۱۷ با حوزه هوش مصنوعی آشنا شد؛ زمانی که یادگیری عمیق به سرعت در حال تحول دنیای علوم کامپیوتر بود. او بعدها متوجه شد که همان زمان مقاله مشهور «Attention Is All You Need» که معماری ترنسفورمر (Transformer) را معرفی کرد، منتشر شده بود. چند سال بعد و پس از دریافت مدرک دکتری، در شرکت ‌Hugging Face مشغول به کار شد؛ جایی که همزمان با جلب توجه جهانی توسط ‌ChatGPT بود.

موضوع اصلی کتاب Reinforcement Learning from Human Feedback «یادگیری تقویتی از بازخورد انسانی» (RLHF) است. این روش پس از انتشار ChatGPT به شهرت رسید و یکی از عوامل کلیدی تبدیل GPT-3.5 به نسخه‌ای بود که کاربران آن را به عنوان ChatGPT می‌شناسند. نویسنده که چند سال در زمینه ساخت مدل‌های مشابه ChatGPT تحقیق کرده، معتقد است اطلاعات عمومی درباره RLHF هنوز بسیار محدود است و حتی توضیحات پایه‌ای بسیاری از الگوریتم‌های آموزشی به سختی یافت می‌شود. هدف کتاب این است که به مرجع اصلی و جامع RLHF تبدیل شود.

او توضیح می‌دهد که RLHF و مفهوم گسترده‌تر «پس‌آموزش» (Post-Training) از یک موضوع پژوهشی تخصصی به یکی از مهم‌ترین روش‌های تعیین رفتار سیستم‌های هوش مصنوعی مدرن تبدیل شده‌اند. با بزرگ‌تر شدن مدل‌های زبانی، نقش داده‌های انسانی نیز اهمیت بیشتری پیدا کرده و همین موضوع باعث رشد سریع این حوزه شده است.

نویسنده همچنین اشاره می‌کند که ورود به دنیای RLHF دشوار به نظر می‌رسد، زیرا این حوزه ترکیبی از یادگیری تقویتی، یادگیری نظارت‌شده، تعامل انسان و کامپیوتر، فلسفه، اقتصاد و مهندسی نرم‌افزار است. این کتاب با هدف ساده‌تر کردن یادگیری RLHF نوشته شده و برای طیف گسترده‌ای از مخاطبان، از علاقه‌مندان به مفاهیم نظری گرفته تا افرادی که به مثال‌های کدنویسی نیاز دارند، مناسب است.

در پایان، نویسنده ابراز امیدواری می‌کند که کتاب Reinforcement Learning from Human Feedback به یک مرجع قابل اعتماد برای جامعه رو‌به‌رشد هوش مصنوعی تبدیل شود و جایگاهی ماندگار در کتابخانه دیجیتال و فیزیکی خوانندگان پیدا کند.

کتاب Reinforcement Learning from Human Feedback درباره چیست؟

این کتاب یک نمای جامع از یادگیری تقویتی مبتنی بر بازخورد انسانی (RLHF) ارائه می‌دهد و توضیح می‌دهد که این روش چیست، چگونه اجرا می‌شود و چه جایگاهی در فرایند «پس‌آموزش» (Post-Training) مدل‌های هوش مصنوعی دارد.

RLHF حوزه‌ای پیچیده و میان‌رشته‌ای است که مفاهیمی از یادگیری تقویتی، نظریه یادگیری ماشین، برنامه‌نویسی، فلسفه، داده، تجربه کاربری (UX) و طراحی محصول را در بر می‌گیرد. کتاب تلاش می‌کند ضمن ارائه دیدگاهی عملی، دلایل، انگیزه‌ها و شهود پشت روش‌های مختلف RLHF را نیز توضیح دهد.

نویسنده تأکید می‌کند که توسعه مدل‌های هوش مصنوعی در عمل فرایندی پیچیده و گاهی نامنظم است و بسیاری از موضوعات مهم RLHF هنوز منابع مرجع استاندارد ندارند. همچنین به دلیل سرعت بالای پیشرفت مدل‌های زبانی بزرگ (LLMها)، بسیاری از نتایج پژوهشی به‌سختی قابل تکرار هستند. به همین دلیل خوانندگان تشویق می‌شوند به جای اتکا به یک مقاله، چندین منبع مختلف را مطالعه کنند.

هدف کتاب این نیست که یک کتاب درسی کامل باشد، بلکه می‌خواهد حداقل دانش لازم برای شروع کار عملی با RLHF یا مطالعه مقالات پژوهشی این حوزه را در اختیار خواننده قرار دهد.


کتاب Reinforcement Learning from Human Feedback برای چه کسانی مناسب است؟

کتاب برای افرادی نوشته شده که آشنایی مقدماتی با موارد زیر دارند:

  • مدل‌های زبانی (LLMs)
  • یادگیری تقویتی (RL)
  • یادگیری ماشین (Machine Learning)

این کتاب همه جزئیات فنی را پوشش نمی‌دهد و بیشتر بر مفاهیم و روش‌های کلیدی موردنیاز برای درک RLHF تمرکز دارد.


ساختار کتاب Reinforcement Learning from Human Feedback

کتاب در چهار بخش اصلی سازمان‌دهی شده است:

بخش اول: آشنایی با RLHF

بخش 1 کتاب Reinforcement Learning from Human Feedback

  • معرفی RLHF و دلایل استفاده از آن
  • تاریخچه‌ای از پژوهش‌هایی که به ظهور ChatGPT منجر شدند
  • مرور مفاهیم پایه یادگیری تقویتی و تفاوت‌های آن در مدل‌های زبانی

بخش دوم: روش‌های اصلی آموزش

بخش 2 کتاب Reinforcement Learning from Human Feedback

سه مرحله کلاسیک RLHF:

  1. Instruction Fine-Tuning (SFT)
    آموزش اولیه مدل برای پاسخ‌گویی به دستورها و پرسش‌ها
  2. Reward Model (مدل پاداش)
    یادگیری ترجیحات انسانی و تبدیل آن‌ها به یک تابع پاداش
  3. Reinforcement Learning
    بهینه‌سازی مدل بر اساس پاداش‌های یادگرفته‌شده

همچنین روش‌های مهم دیگر پس‌آموزش معرفی می‌شوند:

  • RLVR (یادگیری تقویتی با پاداش‌های قابل راستی‌آزمایی)
  • DPO و سایر الگوریتم‌های هم‌ترازی مستقیم (DAA)
  • Rejection Sampling (نمونه‌گیری ردشونده)

بخش سوم: داده‌های انسانی و مصنوعی

بخش 3 کتاب Reinforcement Learning from Human Feedback

موضوعات این بخش:

  • ترجیحات انسانی چیست و چرا اهمیت دارند؟
  • نحوه جمع‌آوری و آماده‌سازی داده‌های ترجیحی
  • تولید داده مصنوعی توسط مدل‌های هوش مصنوعی
  • رویکرد Constitutional AI شرکت ‌Anthropic که در آن مدل‌ها بر اساس مجموعه‌ای از اصول به خود بازخورد می‌دهند.

بخش چهارم: چالش‌های عملی

بخش 4 کتاب Reinforcement Learning from Human Feedback

مهم‌ترین موضوعات:

  • استفاده از ابزارها و APIها توسط مدل‌ها
  • مشکل Reward Hacking (فریب دادن تابع پاداش)
  • روش‌های Regularization برای کنترل بهینه‌سازی
  • ارزیابی و سنجش عملکرد مدل‌ها
  • تأثیر RLHF بر شخصیت، رفتار و تجربه کاربری مدل‌های هوش مصنوعی

ضمیمه‌ها و منابع تکمیلی

کتاب Reinforcement Learning from Human Feedback دارای سه ضمیمه است که شامل:

  • مفاهیم و فرمول‌های ریاضی پایه
  • نکات نگارشی و اطلاعات تکمیلی
  • مشکلات عملی رایج در فرایند آموزش

همچنین نمونه‌کدها، نمودارها و منابع آموزشی رایگان برای مطالعه بیشتر در اختیار خوانندگان قرار گرفته است.


سرفصل‌های کتاب Reinforcement Learning from Human Feedback:

  • Reinforcement Learning from Human Feedback
  • copyright
  • contents
  • foreword
  • preface
  • acknowledgments
  • about this book
  • about the author
  • about the cover illustration
  • Part 1. Overview
    • 1 Introduction
    • 2 A tiny history of RLHF
    • 3 Training overview
  • Part 2. Core training methods
    • 4 Instruction fine-tuning
    • 5 Reward modeling
    • 6 Reinforcement learning
    • 7 Reasoning and inference-time scaling
    • 8 Direct-alignment algorithms
    • 9 Rejection sampling
  • Part 3. Data and preferences
    • 10 The nature of preferences
    • 11 Preference data
    • 12 Synthetic data
  • Part 4. Applications and advanced topics
    • 13 Tool use and function calling
    • 14 Over-optimization
    • 15 Regularization
    • 16 Evaluation
    • 17 Crafting model character and products
  • A. Definitions
  • B. Beyond “just style”
  • C. Practical issues
  • references

جهت دانلود کتاب Reinforcement Learning from Human Feedback می‌توانید پس از پرداخت، دریافت کنید.