Build and Train a 25M Parameter LLM From Scratch on Your CPU

ساخت و آموزش یک مدل زبانی بزرگ (LLM) با ۲۵ میلیون پارامتر از صفر روی پردازنده مرکزی (CPU)

برای یادگیری نحوه کار هوش مصنوعی پیشرفته مدرن، به یک کلاستر پردازنده گرافیکی (GPU) عظیم نیاز ندارید. در ویدیوی جدید ما در کانال YouTube پلتفرم freeCodeCamp.org، یک پارامتر ۲۵ میلیونی کارآمد را می‌سازید، پیش‌آموزش می‌دهید و تنظیم دقیق می‌کنید...

برای یادگیری نحوه کار هوش مصنوعی پیشرفته مدرن، به یک کلاستر پردازنده گرافیکی (GPU) عظیم نیاز ندارید. در ویدیوی جدید ما در کانال YouTube پلتفرم freeCodeCamp.org، یک مدل زبانی با ۲۵ میلیون پارامتر را می‌سازید، پیش‌آموزش می‌دهید و تنظیم دقیق (Fine-tune) می‌کنید که مستقیماً روی لپ‌تاپ یا CPU معمولی شما اجرا می‌شود.

آزمایشگاه‌های پیشرو، سیستم‌های عظیمی با میلیاردها پارامتر آموزش می‌دهند، اما معماری اصلی، ریاضیات و جریان‌های کاری اساساً یکسان هستند. مقیاس‌پذیر کردن معماری به ۲۵ میلیون پارامتر با یک واژه‌نامه فشرده در سطح بایت، هزینه‌های سنگین پردازش ابری را حذف می‌کند و به حلقه‌های آموزشی اجازه می‌دهد در چند ثانیه به‌صورت محلی روی CPU شما اجرا شوند. این تکرار سریع به شما امکان می‌دهد به‌طور مستقیم مشاهده کنید که چگونه تغییرات در برنامه‌های درسی داده‌ها، توابع تلفات (Loss functions) و طراحی پاداش‌ها، رفتار مدل را در زمان واقعی تغییر می‌دهند.

در اینجا برخی از مطالب پوشش داده شده در این دوره آورده شده است:

  • معماری مدرن LLM: بیاموزید که تکنیک‌های پیشرفته چگونه در پشت صحنه کار می‌کنند، از جمله توجه خطی/تکه‌ای ترکیبی (hybrid linear/sparse attention)، ترکیب کارشناسان (MoE)، وزن‌های جاسازی گره‌خورده (tied embedding weights)، و ورودی‌های پچ تصویر چندوجهی.
  • پیش‌آموزش از صفر: تماشا کنید که مدل از تولید کاراکترهای تصادفی شروع می‌کند و گام‌به‌گام با استفاده از تابع تلفات آنتروپی متقاطع (cross-entropy loss)، نحو و ساختار پایتون را یاد می‌گیرد.
  • پس‌آموزش با یادگیری تقویتی (RL): یک حلقه یادگیری تقویتی سبک‌وزن بسازید که در آن مدل کد می‌نویسد، در برابر تست‌های واحد خودکار اجرا می‌شود و پاداش دریافت می‌کند — و نرخ موفقیت خود را در انجام وظایف از ۰٪ تا قبولی در اکثریت ارتقا می‌دهد.
  • پژوهشگران هوش مصنوعی در واقعیت چگونه کار می‌کنند: یاد بگیرید که چگونه با شکل دادن به فرضیه‌های قابل آزمایش، تغییر دادن دما و ساختارهای پاداش، و بررسی معناداری آماری واقعی در چندین بذر (Seed)، مانند یک پژوهشگر مدرن فکر کنید.

آموزش کامل را به‌صورت رایگان در کانال YouTube پلتفرم freeCodeCamp.org تماشا کنید (مدت زمان: ۱ ساعت).

نظر مهندس بهمن آبادی: بزرگ‌ترین اشتباه ما در یادگیری هوش مصنوعی این است که فکر می‌کنیم بدون دسترسی به کلاسترهای سنگین GPU نمی‌توانیم مکانیک درونی مدل‌ها را درک کنیم. پیاده‌سازی یک LLM کوچک ۲۵ میلیونی روی CPU، با حذف هزینه‌ها و پیچیدگی‌های ابری، سرعت لوپ‌های تجربی و درک شهودی ما از توابع تلفات و یادگیری تقویتی را به شدت افزایش می‌دهد. این دقیقاً همان مسیر میانبری است که هر برنامه‌نویس جدی برای تسلط واقعی بر مهندسی LLM به آن نیاز دارد.

منبع: https://www.freecodecamp.org/news/build-and-train-a-25m-parameter-llm-from-scratch-on-your-cpu/