من چندان به هوش مصنوعی چندوجهی (Multimodal) به چشم یک ویژگی تخصصی در یک محصول نگاه نمیکنم، بلکه آن را یک دستهبندی (Category) مجزا میدانم. این نحوه نگاه کردن اهمیت زیادی دارد، بنابراین اجازه دهید کمی روی آن وقت بگذارم.
تمامی تحولات بزرگ پلتفرمی در ۳۰ سال گذشته مسیر مشابهی را طی کردهاند. قابلیتی که زمانی یک ویژگی تخصصی محسوب میشد، به یک پیشفرض تبدیل شد و شرکتهایی که با آن به عنوان یک ویژگی برخورد کردند، از شرکتهایی که آن را به عنوان یک دسته دیدند عقب ماندند. وب در دهه ۱۹۹۰. موبایل در اواخر دهه ۲۰۰۰. ساختار بستر ابری (Cloud-native) در دهه ۲۰۱۰. در هر مورد، پیشگامانی که سیستمهای خود را حول دسته جدید بازسازی کردند، ارزش نامتناسبی را تصاحب کردند، و آنهایی که این قابلیت را روی سیستمهای موجود سوار کردند، در نهایت مجبور شدند بعداً با هزینه بیشتری سیستم خود را بازنویسی کنند.
هوش مصنوعی چندوجهی همان تحولی است که هماکنون در حال رخ دادن است. سمتِ مدلِ این زیرساخت (Stack) قبلاً از این خط عبور کرده است. مدلهای پایه از شرکتهای انتروپیک (Anthropic)، OpenAI و گوگل اکنون میتوانند به صورت بومی روی متن، تصاویر، صوت و در برخی موارد ویدیو طی یک پردازش واحد (Forward pass) استدلال کنند. مدلهای چندوجهی متنباز (Open-weight) نیز به سرعت در حال کم کردن این فاصله هستند. شما دیگر برای استدلال روی یک فاکتور اسکنشده، یک رونوشت از تماس پشتیبانی و یک ضبط صفحه (Screen recording)، به ناوگانی از رمزگذارهای مخصوص هر وجه و یک لایه ترکیب شکننده نیاز ندارید. در عوض، به یک لایه زمینه (Context layer) نیاز دارید که همه آنها را برای مدلی آماده کند که از قبل میتواند آنها را با هم مدیریت کند.
سمتِ تقاضا نیز از این خط عبور کرده است. شبکههای مراقبتهای بهداشتی در حال ادغام تصویربرداری، یادداشتها، علائم حیاتی و ادعاها برای پشتیبانی از تریاژ سریعتر و صورتحسابنویسی قابل دفاعتر هستند. بانکها و شرکتهای فناوری مالی (Fintech) در حال ترکیب آپلود فایلهای متنی، بررسیهای بیومتریک، تأیید هویت صوتی و افشاهای ساختاریافته برای فرآیند ورود مشتری (Onboarding) هستند. مراکز تماس در حال ترکیب صدا، تصاویر صفحه، تیکتها و سلامت حساب کاربری در دستیابی به دستیارهای هوشمند لحظهای برای اپراتورها هستند.
شرکتهای مخابراتی در حال همبستگی دادن تلهمتری شبکه با تصاویر میدانی و یادداشتهای تکنسینها هستند. پلتفرمهای رسانهای در حال یکپارچهسازی ویدیو، رونوشتها و سیگنالهای تعامل برای سیستمهای توصیهگر هستند. اپراتورهای صنعتی در حال جفت کردن فیدهای دوربین با دادههای حسگر برای بازرسی و تشخیص ناهنجاری هستند. اینها برنامههای زندهای هستند که در حال اجرایند، نه پروژههای آزمایشی آینده، و مهندسی داده زیربنای هر یک از آنها جایی است که بیشترین ریسک در آن نهفته است.
تحقیقات نیز مؤید همین موضوع است. گارتنر (Gartner) پیشبینی میکند که هوش مصنوعی مولد چندوجهی از حدود ۱ درصد استقرارها در سال ۲۰۲۳ به حدود ۴۰ درصد تا سال ۲۰۲۷ رشد خواهد کرد. شرکت IDC سالهاست اعلام کرده که حدود ۸۰ درصد از دادههای سازمانی بدون ساختار هستند، و تخمینهای جدیدتر آن با توجه به رشد حجم دادههای ویدیویی، صوتی و حسگرها، این رقم را به حدود ۹۰ درصد نزدیکتر میداند. مککینزی (McKinsey) گزارش داده است که پذیرش هوش مصنوعی مولد در سازمانها از سال ۲۰۲۳ تا ۲۰۲۴ تقریباً دو برابر شده و همچنان در حال رشد است. این یک تغییر دستهبندیشونده در آنچه شرکتها در حال ساخت آن هستند محسوب میشود و از پیش در جریان است.
علاوه بر این، شاخصهای هوش مصنوعی MIT Sloan و استنفورد هر دو از شکاف در حال عمیقتر شدنی خبر میدهند که میان شرکتهایی که بازگشت سرمایه (ROI) ملموسی از هوش مصنوعی میبینند و آنهایی که نمیبینند وجود دارد، و ویژگی تعیینکننده رهبران این عرصه، سرمایهگذاری آنها روی داده و لایه زمینه است، نه خود مدل. برندگان کسانی هستند که دادههای بدون ساختار و چندوجهی خود را به عنوان یک مسئله مهندسی درجه یک در نظر میگیرند.
با جمع زدن همه این موارد، تصویر کاملاً روشن است: چندوجهی همان جایی است که شرکتها همیشه در آن بودهاند و هوش مصنوعی اکنون در حال رسیدن به آن است. مدلها آمادهاند، دادهها از پیش در درون هر سازمان بزرگی وجود دارند، و کاری که با کمبود مواجه است، ساختن و اجرای لایه زمینهای است که این دو را به یکدیگر متصل میکند. موضوع کتاب Data Engineering for Multimodal AI دقیقاً همین کار است.
چرا کتاب Data Engineering for Multimodal AI را نوشتم
من بیشتر دوران حرفهای خود را در نزدیکی دادههای سازمانی سپری کردهام و تحولات دیجیتال پیچیدهای را برای شرکتهای دادهمحور در لیستهای Fortune 50 و Fortune 500 رهبری کردهام. در طول این سالها، چیزی که متوجه شدم این است که شکل دادهها در هر صنعت تغییر میکند، اما یک چیز ثابت میماند.
مهمترین دادهها در ردیفها و ستونهای مرتب قرار ندارند و حتی در آن یک فایل اکسل که هر روند کاری را میتوان به آن ردیابی کرد نیز یافت نمیشوند. این آرایش به عنوان یک میم (شعار شبکههای اجتماعی) خوب به نظر میرسد، اما واقعیت این است که تمام هوش تجاری مهم معمولاً در فایلهای ضبطشده تماسها، اسناد مهندسی، تصاویر میدانی، جریانهای حسگر، ویدیوهای محصولات، یادداشتهای تراکنش، فرمهای ادعا، تیکتهای پشتیبانی و کاغذبازیهای اسکنشدهای نهفته است که شخصی در سال ۲۰۱۷ آپلود کرده و دیگر هرگز به آنها نگاه نکرده است.
جادو همیشه در یادداشتهای دستنویسی که به صورت آزاد در فیلدهای سیستم مدیریت ارتباط با مشتری (CRM) ثبت شدهاند، گفتگوهای فنی عمیق با ذینفعان در جلسات صبح دوشنبه، و درسهای آموختهشده توسط بهترین نمایندگان فروش و خدمات مشتری پنهان است که تنها از طریق مکالمات و زمینه رمزگشایی میشوند.
جادو همیشه بدون ساختار و آشفته است و کاملاً چندوجهی است. هر اقدام سازمانی ردپایی چندوجهی دارد. و در کار من، تمام راهها مرا به سمت یک مهندس داده با تجربه هدایت میکرد که فرمول جادویی برای درست کردن کارها را در اختیار داشت.
این چیزی است که مدام میدیدم. تیمها با عجله یک برنامه هوش مصنوعی را روی دادهها پیادهسازی میکردند بدون اینکه درک روشنی از لایه داده زیرین آن داشته باشند. یک سیستم تولید افزوده با بازیابی (RAG) قطعه اشتباهی را بازیابی میکرد زیرا پایپلاین ورود داده (Ingestion pipeline)، ساختار سند را حذف کرده بود. یک ایجنت (Agent) به دلیل عدم انجام تطبیق موجودیتها (Entity resolution) در سیستمها، در وجههای مختلف حرف خودش را نقض میکرد.
یک مدل تریاژ بالینی در ارزیابی دقیق به نظر میرسید اما در محیط عملیاتی (Production) شکست میخورد زیرا جریان علائم حیاتی و فید تصویربرداری روی ساعتهای متفاوتی همگامسازی شده بودند. هیچکدام از اینها مشکل مدل هوش مصنوعی نبودند. همگی مشکلات زیرساخت داده بودند که لباس مدل هوش مصنوعی را به تن کرده بودند. برنامههای کاربردی هوش مصنوعی انعطافپذیر روی یک لایه داده انعطافپذیر ساخته میشوند. پیشفرض کتاب Data Engineering for Multimodal AI همین است.
بدون درک بنیادی و قوی از نحوه ورود، نمایش، همگامسازی، مدیریت و ارائه دادههای چندوجهی، هر برنامه هوش مصنوعی که منتشر میکنید تنها به اندازه یک رانش طرحواره (Schema drift) یا یک تغییر بالادستی با شکستی بسیار دشوار در عیبیابی فاصله دارد. با یک معماری دادهی مستحکم، همان برنامه به چیزی تبدیل میشود که ممکن است لازم باشد سالها آن را تکامل دهید.
میخواهم در این فرصت دیدگاه دیگری را مطرح کنم. ما به این کار مهندسی داده میگوییم زیرا این واژگان امروزِ صنعت است. در عمل، آنچه کتاب Data Engineering for Multimodal AI آموزش میدهد به مهندسی زمینه (Context engineering) برای هوش مصنوعی چندوجهی نزدیکتر است. به عنوان یک مهندس داده مدرن، شما بیش از هر کس دیگری به زمینهای که یک مدل یا یک ایجنت روی آن استدلال میکند نزدیک هستید. لایه معنایی. گراف موجودیت. رویداد همگامسازیشده. امبینگ (Embedding) مدیریتشده. مسیر بازیابی که شواهد درست را در زمان مناسب ظاهر میکند. مدلها و ایجنتها مصرفکنندگان آن زمینه هستند، بنابراین هر کاری که آنها در محیط عملیاتی انجام میدهند به نحوه شکلدهی شما به آن زمینه محدود میشود.
عادتهایی که مهندسی داده خوب را تعریف میکنند (مانند قراردادها، خطمشیها، نظم طرحواره، همتواندی (Idempotency)، قابلیت مشاهده، و احترام عمیق به آنچه هنگام اشتراکگذاری یک شناسه توسط دو سیستم رخ میدهد) همان عادتهایی هستند که سیستمهای هوش مصنوعی چندوجهی را در کنار هم نگه میدارند. این یک توسعه طبیعی از حرفهای است که بسیاری از ما از قبل آن را تمرین میکنیم. با این حال، مهندسی زمینه فقط یک شغل در حوزه مهندسی داده نیست. مهندسین یادگیری ماشین، مهندسین پلتفرم، دانشمندان کاربردی و مهندسین نرمافزاری که بر اساس تفکر سیستمی کار میکنند، همگی میتوانند این کار را انجام دهند و بهترین تیمهایی که دیدهام، همه آنها را در یک اتاق دور هم جمع میکنند. اگر کتاب Data Engineering for Multimodal AI را میخوانید و از یکی از این پسزمینهها آمدهاید، اینجا خوش آمدید و الگوهای موجود در این فصلها متعلق به شماست تا از آنها استفاده کنید.
من کتاب Data Engineering for Multimodal AI را نوشتم تا بخش سخت کار از قبل انجام شده باشد. من با غواصی عمیق در حوزههای مراقبتهای بهداشتی، تجارت، رباتیک، کشاورزی و عملیات سازمانی، تجربه خود را گسترش دادم و در حین نوشتن، سیستمهایی را که کار میکردند و آنهایی را که به سادگی کار نمیکردند مورد مطالعه قرار دادم. سپس آنچه را که آموخته بودم در قالب الگوها، نمودارها و راهنماهای قابل اجرا فشرده کردم. اکنون نسخه ویرایششده، مهمترین و بنیادیترین نسخه از آنچه نیاز دارید در اختیار شماست. این همان چیزی است که یک راهنمای میدانی خوب برای آن ساخته شده است.
کتاب Data Engineering for Multimodal AI چگونه ساخته شد
پیشینه من در حوزه دادههای سازمانی است. من سالها در رسانهها، فناوریهای پیشرفته، مخابرات و خدمات حرفهای کار کردهام و روی انوع سیستمهایی کار کردهام که در آنها اشتباه در لایه داده سه هفته بعد به صورت یک مسئله نظارتی، تشدید نارضایتی مشتری یا از دست رفتن درآمد ظاهر میشود. آن صنایع به من آموختند که چگونه قبل از فکر کردن به هر چیز دیگری، برای قابلیت اطمینان و حاکمیت (Governance) طراحی کنم.
هنگام نوشتن کتاب Data Engineering for Multimodal AI، آن تجربه را به حوزههایی که مستقیماً در آنها کار نکرده بودم گسترش دادم. برای اینکه حس درستی از گستردگی این صنعت پیدا کنید، تصمیم گرفتم خودم (و شما) را به یک سفر میدانی ببرم. من سیستمهای پشتیبانی تصمیم بالینی در مراقبتهای بهداشتی، معماریهای توصیهگر و تحقق سفارش در تجارت اجتماعی، کشاورزی دقیق در مزارع فعال، پایپلاینهای داده خودروهای خودران و رباتیک، و ستونهای فقرات مراقبتهای بهداشتی در سراسر کشور که میلیونها سند را با رعایت مقرراتی مانند قانون انتقال و مسئولیت بیمه سلامت (HIPAA) و قانون هوش مصنوعی اتحادیه اروپا (EU AI Act) مدیریت میکنند، مطالعه کردم.
من از مجموعه دادههای عمومی، پیادهسازیهای متنباز و مقالات پژوهشی استفاده کردم و الگوهایی را که میدیدم با الگوهایی که از کار در سازمانها میشناختم مقایسه کردم. آنچه مدام ظاهر میشد همان مجموعه کوچک و ثابتی از ایدههای معماری بود که با واژگان صنایع مختلف پوشانده شده بودند.
کتاب Data Engineering for Multimodal AI حول همین بینش سازماندهی شده است. هر فصل یک چالش معماری واحد را در بر میگیرد و آن را در قالب یک مطالعه موردی برگرفته از یک صنعت متفاوت ریشهیابی میکند. ما از این مطالعه موردی برای باز کردن الگوهای مستقل از حوزه استفاده میکنیم. تا زمانی که مطالعه را به پایان برسانید، ایدههای اصلی مانند قراردادها، همگامسازی معنایی، بازیابی مرحلهای، قراردادهای وجهی (Modal contracts) و استدلال ایجنتی محدودشده را خواهید دید که از طریق ۱۱ لنز مختلف صنعتی مشاهده و اصلاح شدهاند. این دیدگاه بینصنعتی مفیدترین چیزی است که کتابی مانند این میتواند به شما ارائه دهد و این همان چیزی است که من بیش از همه در دوران حرفهای خودم به آن نیاز داشتم و هرگز آن را در یک جا پیدا نکرده بودم.
چه کسانی باید کتاب Data Engineering for Multimodal AI را بخوانند
این کتاب برای متخصصانی است که سیستمهای هوش مصنوعی را میسازند که روی بیش از یک نوع داده استدلال میکنند. اگر مهندس داده، مهندس یادگیری ماشین، مهندس پلتفرم، سرپرست فنی یا معمار هستید، خود را در صفحات این کتاب خواهید یافت. اگر دانشمند کاربردی یا مهندس نرمافزاری هستید که به سمت زیرساخت هوش مصنوعی حرکت میکنید، فصلهای مربوط به ویژگیها، بازیابی و ارکستراسیون (Orchestration) مدلهای ذهنی را به شما میدهند که همتیمیهایتان از قبل فرض کردهاند شما از آنها برخوردارید.
اگر با مفاهیم بستر ابری (Cloud-native) راحت هستید، حداقل با یک پلتفرم استریم یا چارچوب دستهای (Batch framework) کار کردهاید و درک تقریبی از اینکه امبینگ (Embedding) چیست و چرا ایندکس برداری وجود دارد دارید، بیشترین بهره را از کتاب Data Engineering for Multimodal AI خواهید برد.
نیازی نیست ترنسفورمرها را از درون بشناسید. نیازی به پیشینه پژوهشی در یادگیری ماشین ندارید. آنچه نیاز دارید تمایل به تفکر سیستمی، اهمیت دادن به روابط میان وجهها، و در نظر گرفتن کیفیت دادهها به عنوان یک مسئله طراحی به جای یک چکلیست است.
اگر در ابتدای مسیر حرفهای خود هستید، کتاب Data Engineering for Multimodal AI شما را به چالش خواهد کشید و این جزو اهداف طراحی آن است. این راهنماها ساختارهای چندوجهی کاربردی را به شما میدهند که بسیار معدودی از مهندسین در سطح شما تاکنون آنها را پیادهسازی کردهاند.
اگر مهندس ارشد یا سرپرست فنی هستید، الگوهای معماری و چارچوب بینصنعتی به گونهای طراحی شدهاند که ماهها زمان کشف و تحقیق را در ابتکار عمل بعدی چندوجهی برای شما صرفهجویی کنند. اگر مدیر یا معمار هستید و جهتگیری پروژهها را تعیین میکنید، کتاب Data Engineering for Multimodal AI واژگان مشترکی را به شما میدهد که میتوانید آن را به تیم خود ارائه دهید.
از کتاب Data Engineering for Multimodal AI چه چیزی به دست خواهید آورد
من قصد دارم شما با سه دستاورد از این کتاب خارج شوید:
اول، مجموعهای پایدار از مدلهای ذهنی معماری. لایه معنایی. قراردادهای داده. چرخه عمر دادههای چندوجهی. مثلث استنتاج. قراردادهای وجهی. استدلال ایجنتی محدودشده. استنتاج طبقهبندیشده. اینها ایدههایی هستند که در طول نسلهای مختلف ابزارها و تغییرات در چشمانداز مدلهای پایه پابرجا میمانند. صنعت هر سمتی که طی دو یا پنج سال آینده برود، اینها همچنان چارچوبهایی خواهند بود که از طریق آنها آن را ارزیابی خواهید کرد.
دوم، کتابخانهای بینصنعتی از نمونههای کاربردی. هر فصل در یک شرکت خیالی الهامگرفته از صنعت لنگر انداخته است (اگر الهام واقعی آن را تشخیص دهید امتیاز میگیرید):
-
Granite: یک پلتفرم مراقبتهای بهداشتی سازمانی
-
StreamBuy: یک سیستم تجارت اجتماعی (Social commerce)
-
Revault: مدیر سرمایهگذاری دیجیتالمحور و پذیرش تنظیمشده مقرراتی
-
ByteEats: یک آشپزخانه ابری
-
BayGo: یک شرکت خودروی خودران
-
TelMo: یک شبکه مخابراتی
-
FieldSense: عملیات پهپادی کشاورزی دقیق
-
ForgeSense: سازنده مدلهای رفتاری بزرگ برای رباتیک
-
Atlas Health AI: ستون فقرات مراقبتهای بهداشتی در سراسر کشور
-
Eighteen Labs: ارائهدهنده رباتهای سازمانی در انبارها، مراکز داده و بیمارستانها
-
StreamKit: چارچوب هوش مرکز تماس
یک رشته. یازده صنعت. کتابخانهای از الگوها که میتوانید آنها را روی هر چیزی که در حال ساختنش هستید نگاشت کنید.
سوم، سبدی از راهنماهای عملی (Playbooks). هر فصل با یک ساختار قابل اجرا به پایان میرسد. تا پایان کتاب، شما یک پایپلاین لایه معنایی مینیمال، یک انبار ویژگی چندوجهی (Multimodal feature store)، یک سیستم زمینه بدون سرور (Serverless context system)، یک پایپلاین ورود ترکیبی داده، یک پایپلاین مهندسی ویژگی روی مجموعه داده باز Waymo، یک موتور بازیابی گراف-افزوده با کشسازی آگاه از لبه (Edge-aware caching)، یک روتر استنتاج چندوجهی لحظهای، یک پایپلاین MLOps با بازآموزی مبتنی بر رانش، یک پایپلاین مقیاسپذیری بنچمارکشده چندچارچوبی، یک سرویس استنتاج مدیریتشده با استقرار قناری (Canary rollout)، یک پایپلاین حاکمیت چندوجهی با ممیزیهای خطمشی و منصفانه بودن، و یک پایپلاین تحلیل ریشه مشکل چندوجهی روی مجموعه داده LEMMA-RCA را راهاندازی کردهاید. دوازده ساخت. یک سبد. متعلق به شما برای فورک کردن و توسعه دادن.
نحوه هدایت در کتاب Data Engineering for Multimodal AI
این کتاب در چهار بخش سازماندهی شده است.



اگر سیستمهای چندوجهی برای شما جدید هستند، فصلها را به ترتیب بخوانید. از طرف دیگر، اگر میخواهید ستون فقرات معماری را از کوتاهترین مسیر درک کنید، به فصلهای ۱، ۷، ۱۰ و ۱۲ مراجعه کنید. هر فصل همچنین میتواند به عنوان یک منبع مستقل زمانی که مسئله خاصی روی میز کار خود دارید عمل کند. بخش ضمائم، مجموعه دادههای عمومی ارجاعدادهشده در سراسر کتاب را جمعآوری میکند: وجههایی که پوشش میدهند، کاربرد آنها و محل یافتنشان. از آن به عنوان نقطه شروعی برای راهنماها و ساخت پایپلاینهای چندوجهی خود استفاده کنید.