ساخت و آموزش یک مدل زبانی بزرگ (LLM) با ۲۵ میلیون پارامتر از صفر روی پردازنده مرکزی (CPU)
برای یادگیری نحوه کار هوش مصنوعی پیشرفته مدرن، به یک کلاستر پردازنده گرافیکی (GPU) عظیم نیاز ندارید. در ویدیوی جدید ما در کانال YouTube پلتفرم freeCodeCamp.org، یک پارامتر ۲۵ میلیونی کارآمد را میسازید، پیشآموزش میدهید و تنظیم دقیق میکنید...
برای یادگیری نحوه کار هوش مصنوعی پیشرفته مدرن، به یک کلاستر پردازنده گرافیکی (GPU) عظیم نیاز ندارید. در ویدیوی جدید ما در کانال YouTube پلتفرم freeCodeCamp.org، یک مدل زبانی با ۲۵ میلیون پارامتر را میسازید، پیشآموزش میدهید و تنظیم دقیق (Fine-tune) میکنید که مستقیماً روی لپتاپ یا CPU معمولی شما اجرا میشود.
آزمایشگاههای پیشرو، سیستمهای عظیمی با میلیاردها پارامتر آموزش میدهند، اما معماری اصلی، ریاضیات و جریانهای کاری اساساً یکسان هستند. مقیاسپذیر کردن معماری به ۲۵ میلیون پارامتر با یک واژهنامه فشرده در سطح بایت، هزینههای سنگین پردازش ابری را حذف میکند و به حلقههای آموزشی اجازه میدهد در چند ثانیه بهصورت محلی روی CPU شما اجرا شوند. این تکرار سریع به شما امکان میدهد بهطور مستقیم مشاهده کنید که چگونه تغییرات در برنامههای درسی دادهها، توابع تلفات (Loss functions) و طراحی پاداشها، رفتار مدل را در زمان واقعی تغییر میدهند.
در اینجا برخی از مطالب پوشش داده شده در این دوره آورده شده است:
- معماری مدرن LLM: بیاموزید که تکنیکهای پیشرفته چگونه در پشت صحنه کار میکنند، از جمله توجه خطی/تکهای ترکیبی (hybrid linear/sparse attention)، ترکیب کارشناسان (MoE)، وزنهای جاسازی گرهخورده (tied embedding weights)، و ورودیهای پچ تصویر چندوجهی.
- پیشآموزش از صفر: تماشا کنید که مدل از تولید کاراکترهای تصادفی شروع میکند و گامبهگام با استفاده از تابع تلفات آنتروپی متقاطع (cross-entropy loss)، نحو و ساختار پایتون را یاد میگیرد.
- پسآموزش با یادگیری تقویتی (RL): یک حلقه یادگیری تقویتی سبکوزن بسازید که در آن مدل کد مینویسد، در برابر تستهای واحد خودکار اجرا میشود و پاداش دریافت میکند — و نرخ موفقیت خود را در انجام وظایف از ۰٪ تا قبولی در اکثریت ارتقا میدهد.
- پژوهشگران هوش مصنوعی در واقعیت چگونه کار میکنند: یاد بگیرید که چگونه با شکل دادن به فرضیههای قابل آزمایش، تغییر دادن دما و ساختارهای پاداش، و بررسی معناداری آماری واقعی در چندین بذر (Seed)، مانند یک پژوهشگر مدرن فکر کنید.
آموزش کامل را بهصورت رایگان در کانال YouTube پلتفرم freeCodeCamp.org تماشا کنید (مدت زمان: ۱ ساعت).
نظر مهندس بهمن آبادی: بزرگترین اشتباه ما در یادگیری هوش مصنوعی این است که فکر میکنیم بدون دسترسی به کلاسترهای سنگین GPU نمیتوانیم مکانیک درونی مدلها را درک کنیم. پیادهسازی یک LLM کوچک ۲۵ میلیونی روی CPU، با حذف هزینهها و پیچیدگیهای ابری، سرعت لوپهای تجربی و درک شهودی ما از توابع تلفات و یادگیری تقویتی را به شدت افزایش میدهد. این دقیقاً همان مسیر میانبری است که هر برنامهنویس جدی برای تسلط واقعی بر مهندسی LLM به آن نیاز دارد.
منبع: https://www.freecodecamp.org/news/build-and-train-a-25m-parameter-llm-from-scratch-on-your-cpu/