مبانی مدل‌های زبانی بزرگ: عنوان، مجوز، پیشگفتار، نمادگذاری و فهرست مطالب

مبانی مدل‌های زبانی بزرگ: عنوان، مجوز، پیشگفتار، نمادگذاری و فهرست مطالب

توسط admin | گروه هوش مصنوعی | 1405/05/18

نظرات 0

مبانی مدل‌های زبانی بزرگ: عنوان، مجوز، پیشگفتار، نمادگذاری و فهرست مطالب

عنوان اصلی کتاب: Foundations of Large Language Models

نویسندگان: Tong Xiao و Jingbo Zhu

سازمان: NLP Lab, Northeastern University & NiuTrans Research

زبان اصلی: انگلیسی

بازهٔ منبع: صفحات PDF 1 تا 7

مجوز منبع: Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0)

تاریخ ترجمه: 1405/05/18 / 2026-08-09

اعتبار ترجمه: ترجمه با کمک هوش مصنوعی

arXiv:2501.09223v1 [cs.CL] — 16 Jan 2025

مبانی مدل‌های زبانی بزرگ

Foundations of Large Language Models

نویسندگان: Tong Xiao و Jingbo Zhu

تاریخ نسخه: ۱۷ ژانویهٔ ۲۰۲۵

سازمان: آزمایشگاه پردازش زبان طبیعی (NLP Lab)، دانشگاه Northeastern و NiuTrans Research

حق‌نشر و مجوز

حق‌نشر © ۲۰۲۱–۲۰۲۵، Tong Xiao و Jingbo Zhu.

آزمایشگاه پردازش زبان طبیعی، دانشگاه Northeastern و NiuTrans Research.

این اثر تحت مجوز Creative Commons Attribution-NonCommercial 4.0 Unported (CC BY-NC 4.0) منتشر شده است. استفاده از این فایل فقط در چارچوب مفاد مجوز مجاز است. نرم‌افزار/محتوای توزیع‌شده تحت این مجوز، مگر آن‌که قانون لازم‌الاجرا یا توافق کتبی دیگری مقرر کند، «همان‌گونه که هست» و بدون هیچ‌گونه ضمانت صریح یا ضمنی ارائه می‌شود. برای جزئیات حقوق و محدودیت‌ها باید به متن رسمی مجوز مراجعه شود.

تاریخ: ۱۷ ژانویهٔ ۲۰۲۵

پیشگفتار

مدل‌های زبانی بزرگ (Large Language Models یا LLMs) از پردازش زبان طبیعی سرچشمه گرفته‌اند، اما بی‌تردید در سال‌های اخیر به یکی از انقلابی‌ترین پیشرفت‌های فناورانه در حوزهٔ هوش مصنوعی تبدیل شده‌اند. یکی از بینش‌های مهمی که مدل‌های زبانی بزرگ به همراه آورده‌اند این است که دانش مربوط به جهان و زبان‌ها را می‌توان از طریق وظایف مدل‌سازی زبانی در مقیاس بزرگ فراگرفت و از این راه، مدلی عمومی ساخت که بتواند با مسائل گوناگون سروکار داشته باشد. این کشف بر روش‌شناسی پژوهش در پردازش زبان طبیعی و بسیاری از رشته‌های مرتبط تأثیری عمیق گذاشته است. ما از الگوی آموزش سامانه‌های تخصصی از صفر با حجم زیادی از داده‌های برچسب‌خورده، به الگوی تازه‌ای منتقل شده‌ایم که در آن با پیش‌آموزش در مقیاس بزرگ، مدل‌های پایه (Foundation Models) به دست می‌آیند و سپس ریزتنظیم، هم‌تراز و پرامپت‌دهی می‌شوند.

هدف این کتاب ترسیم مفاهیم بنیادی مدل‌های زبانی بزرگ و معرفی فنون مرتبط با آن‌ها است. همان‌طور که از عنوان کتاب برمی‌آید، تمرکز اصلی بر جنبه‌های پایه‌ای مدل‌های زبانی بزرگ است، نه پوشش جامع همهٔ روش‌های پیشرفته و جدید. کتاب از چهار فصل تشکیل شده است:

  • فصل ۱ مبانی پیش‌آموزش (Pre-training) را معرفی می‌کند. پیش‌آموزش زیربنای مدل‌های زبانی بزرگ است و در این فصل روش‌های رایج پیش‌آموزش و معماری‌های مدل بررسی می‌شوند.
  • فصل ۲ مدل‌های مولد (Generative Models) را معرفی می‌کند؛ همان مدل‌هایی که امروزه معمولاً از آن‌ها با عنوان مدل‌های زبانی بزرگ یاد می‌کنیم. پس از معرفی فرایند پایهٔ ساخت این مدل‌ها، روش‌های مقیاس‌دادن آموزش مدل و کار با متن‌های بلند نیز بررسی می‌شوند.
  • فصل ۳ روش‌های پرامپت‌دهی (Prompting) برای مدل‌های زبانی بزرگ را معرفی می‌کند. راهبردهای گوناگون پرامپت‌دهی و نیز روش‌های پیشرفته‌تری مانند استدلال زنجیرهٔ فکر (Chain-of-Thought) و طراحی خودکار پرامپت مورد بحث قرار می‌گیرند.
  • فصل ۴ روش‌های هم‌ترازی (Alignment) مدل‌های زبانی بزرگ را معرفی می‌کند. تمرکز این فصل بر ریزتنظیم مبتنی بر دستور و هم‌ترازی مبتنی بر بازخورد انسانی است.

اگر خواننده با یادگیری ماشین و پردازش زبان طبیعی آشنا باشد و درکی مقدماتی از شبکه‌های عصبی مانند Transformer داشته باشد، مطالعهٔ کتاب نسبتاً آسان خواهد بود. با این حال، نداشتن این پیش‌زمینه نیز مانع جدی نیست، زیرا تلاش شده است محتوای هر فصل تا حد ممکن خودبسنده باشد و خواننده برای دنبال‌کردن مطالب با دشواری بیش از حد روبه‌رو نشود.

در فرایند نگارش این کتاب، به‌تدریج دریافتیم که کتاب بیش از هر چیز شبیه مجموعه‌ای از «یادداشت‌ها»یی است که هنگام یادگیری دربارهٔ مدل‌های زبانی بزرگ تهیه کرده‌ایم. امید داریم این سبک یادداشت‌محور، مسیر یادگیری انعطاف‌پذیری در اختیار خوانندگان قرار دهد؛ چه بخواهند در یک حوزهٔ خاص عمیق شوند و چه در پی درکی جامع از مدل‌های زبانی بزرگ باشند، بتوانند دانش و بینش موردنیاز خود را در این «یادداشت‌ها» بیابند.

از دانشجویان آزمایشگاه و همهٔ دوستانی که دیدگاه‌های خود دربارهٔ مدل‌های زبانی بزرگ را با ما در میان گذاشتند و در اصلاح خطاهای نگارشی کمک کردند سپاسگزاریم. به‌طور ویژه از Weiqiao Shan، Yongyu Mu، Chenglong Wang، Kaiyan Chang، Yuchun Fan، Hang Zhou، Xinyu Liu، Huiwen Bao، Tong Zheng، Junhao Ruan و Qing Yang تشکر می‌کنیم.

نمادگذاری

نمادمعنا
aیک متغیر
aیک بردار سطری یا ماتریس
f(a)تابعِ a
max f(a)بیشینهٔ مقدار f(a)
arg maxa f(a)مقدار a که f(a) را بیشینه می‌کند
xدنبالهٔ توکن ورودی به مدل
xjتوکن ورودی در موقعیت j
yدنبالهٔ توکن خروجی تولیدشده توسط مدل
yiتوکن خروجی در موقعیت i
θپارامترهای مدل
Pr(a)احتمال a
Pr(a|b)احتمال شرطی a با دانستن b
Pr(·|b)توزیع احتمال یک متغیر با شرط b
Prθ(a)احتمال a با پارامتردهی θ
htحالت پنهان در گام زمانی t در مدل‌های دنباله‌ای
Hماتریس همهٔ حالت‌های پنهان در طول زمان در یک دنباله
Q, K, Vماتریس‌های پرس‌وجو (Query)، کلید (Key) و مقدار (Value) در سازوکارهای توجه
Softmax(A)تابع Softmax که بردار یا ماتریس ورودی A را نرمال‌سازی می‌کند
Lتابع زیان (Loss Function)
Dمجموعه‌دادهٔ مورد استفاده برای آموزش یا ریزتنظیم مدل
∂L/∂θگرادیان تابع زیان L نسبت به پارامترهای θ
KL(p || q)واگرایی KL میان توزیع‌های p و q

فهرست مطالب

  1. فصل ۱ — پیش‌آموزش
    • ۱.۱ مدل‌های NLP پیش‌آموخته
      • ۱.۱.۱ پیش‌آموزش بدون‌نظارت، نظارت‌شده و خودنظارتی
      • ۱.۱.۲ سازگارکردن مدل‌های پیش‌آموخته
    • ۱.۲ وظایف پیش‌آموزش خودنظارتی
      • ۱.۲.۱ پیش‌آموزش فقط‌رمزگشا
      • ۱.۲.۲ پیش‌آموزش فقط‌رمزگذار
      • ۱.۲.۳ پیش‌آموزش رمزگذار–رمزگشا
      • ۱.۲.۴ مقایسهٔ وظایف پیش‌آموزش
    • ۱.۳ مثال: BERT
      • ۱.۳.۱ مدل استاندارد
      • ۱.۳.۲ آموزش بیشتر و مدل‌های بزرگ‌تر
      • ۱.۳.۳ مدل‌های کارآمدتر
      • ۱.۳.۴ مدل‌های چندزبانه
    • ۱.۴ به‌کارگیری مدل‌های BERT
    • ۱.۵ جمع‌بندی
  2. فصل ۲ — مدل‌های مولد
    • ۲.۱ معرفی کوتاه مدل‌های زبانی بزرگ
      • ۲.۱.۱ Transformerهای فقط‌رمزگشا
      • ۲.۱.۲ آموزش LLMها
      • ۲.۱.۳ ریزتنظیم LLMها
      • ۲.۱.۴ هم‌ترازکردن LLMها با جهان
      • ۲.۱.۵ پرامپت‌دهی به LLMها
    • ۲.۲ آموزش در مقیاس بزرگ
      • ۲.۲.۱ آماده‌سازی داده
      • ۲.۲.۲ اصلاحات مدل
      • ۲.۲.۳ آموزش توزیع‌شده
      • ۲.۲.۴ قوانین مقیاس‌پذیری
    • ۲.۳ مدل‌سازی دنباله‌های بلند
      • ۲.۳.۱ بهینه‌سازی از دیدگاه رایانش با کارایی بالا (HPC)
      • ۲.۳.۲ معماری‌های کارآمد
      • ۲.۳.۳ کش و حافظه
      • ۲.۳.۴ اشتراک‌گذاری میان سرها و لایه‌ها
      • ۲.۳.۵ برون‌یابی و درون‌یابی موقعیت
      • ۲.۳.۶ ملاحظات
    • ۲.۴ جمع‌بندی
  3. فصل ۳ — پرامپت‌دهی
    • ۳.۱ طراحی عمومی پرامپت
      • ۳.۱.۱ مبانی
      • ۳.۱.۲ یادگیری درون‌متنی
      • ۳.۱.۳ راهبردهای مهندسی پرامپت
      • ۳.۱.۴ مثال‌های بیشتر
    • ۳.۲ روش‌های پیشرفتهٔ پرامپت‌دهی
      • ۳.۲.۱ زنجیرهٔ فکر
      • ۳.۲.۲ تجزیهٔ مسئله
      • ۳.۲.۳ خودبهسازی
      • ۳.۲.۴ تجمیع (Ensembling)
      • ۳.۲.۵ RAG و استفاده از ابزار
    • ۳.۳ یادگیری برای پرامپت‌دادن
      • ۳.۳.۱ بهینه‌سازی پرامپت
      • ۳.۳.۲ پرامپت‌های نرم
      • ۳.۳.۳ کاهش طول پرامپت
    • ۳.۴ جمع‌بندی
  4. فصل ۴ — هم‌ترازی
    • ۴.۱ مروری بر هم‌ترازی LLMها
    • ۴.۲ هم‌ترازی دستور
      • ۴.۲.۱ ریزتنظیم نظارت‌شده
      • ۴.۲.۲ گردآوری دادهٔ ریزتنظیم
      • ۴.۲.۳ ریزتنظیم با دادهٔ کمتر
      • ۴.۲.۴ تعمیم دستور
      • ۴.۲.۵ استفاده از مدل‌های ضعیف برای بهبود مدل‌های قوی
    • ۴.۳ هم‌ترازی ترجیحات انسانی: RLHF
      • ۴.۳.۱ مبانی یادگیری تقویتی
      • ۴.۳.۲ آموزش مدل‌های پاداش
      • ۴.۳.۳ آموزش LLMها
    • ۴.۴ هم‌ترازی بهبودیافتهٔ ترجیحات انسانی
      • ۴.۴.۱ مدل‌سازی پاداش بهتر
      • ۴.۴.۲ بهینه‌سازی مستقیم ترجیح (DPO)
      • ۴.۴.۳ تولید خودکار دادهٔ ترجیح
      • ۴.۴.۴ هم‌ترازی گام‌به‌گام
      • ۴.۴.۵ هم‌ترازی در زمان استنتاج
    • ۴.۵ جمع‌بندی
  5. کتاب‌نامه

امتیاز کاربران به این مقاله

☆☆☆☆☆

0 نفر امتیاز داده اند. میانگین: 0.0 از 5

 

0 نظر

نظر محترم شما در مورد مقاله های وب سایت برنامه نویسی و پایگاه داده

نظرات محترم شما در خدمات رسانی بهتر ما را یاری می نمایند. لطفا اگر مایل بودید یک نظر ما را مهمان فرمائید. آدرس ایمیل و وب سایت شما نمایش داده نخواهد شد.

0 / 500

اطلاعات تماس

  • آدرس:اصفهان-خیابان ام کلثوم غربی - بعد خیابان تخم چی - بیست متر بعد از پیتزا ننه شب - کوچه تعمیر گاه سمار زغالی - پلاک 354 - درب مشکی - طبقه هفتم
  • آدرس ایمیل:najafzade@gmail.com
  • وب سایت:http://www.a00b.com/
  • تلفن ثابت:(+98)9131253620
  • تلفن همراه:09131253620