بهبود هم‌ترازی ترجیحات: مدل پاداش، DPO، دادهٔ خودکار و هم‌ترازی زمان استنتاج

بهبود هم‌ترازی ترجیحات: مدل پاداش، DPO، دادهٔ خودکار و هم‌ترازی زمان استنتاج

توسط admin | گروه هوش مصنوعی | 1405/05/18

نظرات 0

بهبود هم‌ترازی ترجیحات: مدل پاداش، DPO، دادهٔ خودکار و هم‌ترازی زمان استنتاج

عنوان اصلی کتاب: Foundations of Large Language Models

نویسندگان: Tong Xiao و Jingbo Zhu

سازمان: NLP Lab, Northeastern University & NiuTrans Research

زبان اصلی: انگلیسی

بازهٔ منبع: صفحات PDF 194 تا 209

مجوز منبع: Creative Commons Attribution-NonCommercial 4.0 (CC BY-NC 4.0)

تاریخ ترجمه: 1405/05/18 / 2026-08-09

اعتبار ترجمه: ترجمه با کمک هوش مصنوعی

۴.۴ بهبود هم‌ترازی ترجیح انسانی

در بخش قبل مفاهیم پایهٔ reinforcement learning و چارچوب عمومی RLHF بررسی شد. این بخش refinementهای RLHF و روش‌های جایگزین برای human preference alignment را معرفی می‌کند.

۴.۴.۱ مدل‌سازی بهتر پاداش

در بخش ۴.۳.۲، یادگیری از human preference و pairwise ranking loss برای آموزش reward model بررسی شد. در اینجا روش‌های عمومی‌تری برای reward modeling مطرح می‌شوند که به RLHF و مسائل مرتبط قابل اعمال‌اند.

۴.۴.۱.۱ سیگنال‌های نظارت

آموزش reward model را می‌توان مسئله‌ای از جنس ranking دانست: مدل باید به outputها score بدهد به‌گونه‌ای که ترتیب scoreها preference انسانی را بازتاب دهد.

Listwise ranking. pairwise ranking را می‌توان به ranking یک فهرست کامل گسترش داد. برای هر input چند output ساخته و از expert خواسته می‌شود آن‌ها را مرتب کند؛ مثلاً برای {y₁,y₂,y₃,y₄} ممکن است ترتیب y₂ ≻ y₃ ≻ y₁ ≻ y₄ باشد. ساده‌ترین listwise loss، جمع pairwise loss همهٔ زوج‌هاست:

Llist = −E(x,Y)∼D_r[(1/(N(N−1))) Σy_a∈Y,y_b∈Y,y_a≠y_b log Pr(ya ≻ yb|x)]    (4.57)

برای pairwise probability می‌توان همان Bradley–Terry را به کار برد: Pr(y_a≻y_b|x)=Sigmoid(r(x,y_a)−r(x,y_b)).

Plackett–Luce. این مدل Bradley–Terry را به چند item گسترش می‌دهد [Plackett, 1975]. برای هر output در list یک «worth» تعریف می‌شود:

α(y)=exp(r(x,y))    (4.58)
Pr(y selected|x,Y)=α(y)/Σy′∈Yα(y′)=exp(r(x,y))/Σy′∈Yexp(r(x,y′))    (4.59)

اگر list مرتب Ŷ = yj1 ≻ yj2 ≻ … ≻ yjN باشد، log-probability ranking از مجموع احتمال‌های conditional در مراحل انتخاب ساخته می‌شود:

log Pr(Ŷ|x)=Σk=1N log Pr(yjk|x,Ŷ≥k)    (4.60)
Lpl=−E(x,Ŷ)∼D_r[log Pr(Ŷ|x)]    (4.61)

RankNet [Burges et al., 2005]، ListNet [Cao et al., 2007] و روش‌های بسیار دیگری در خانوادهٔ learning-to-rank قرار می‌گیرند و برای preference modeling نیز قابل استفاده‌اند [Liu, 2009; Li, 2011].

Pointwise training. به‌جای مقایسهٔ relative، هر output مستقل score می‌گیرد؛ مثلاً expert rating پنج‌امتیازی می‌دهد. اگر ϕ(x,y) score انسانی باشد، reward model می‌تواند با regression آموزش ببیند:

Lpoint = −E[(ϕ(x,y)−r(x,y))²]    (4.62)

pointwise از نظر مفهومی ساده است اما در RLHF همیشه مناسب نیست، چون ratingهای absolute میان expertها variance و inconsistency بالایی دارند. fitting روی score مشخص همچنین می‌تواند generalization را محدود کند، خصوصاً وقتی data کم است. relative preference معمولاً patternهای عمومی‌تر موفقیت/شکست را بهتر آشکار می‌کند. با این حال اگر annotation دقیق و سازگار ارزان و data فراوان باشد، pointwise روش مناسبی است.

برای robustتر کردن supervision می‌توان regularization افزود. Eisenstein et al. [2023] squared sum reward را به pairwise loss اضافه می‌کنند:

Lreg=−E[log Prφ(ya≻yb|x)] − E[(r(x,ya)+r(x,yb))²]    (4.63)

این regularizer می‌تواند underdetermination reward model ــ وجود چند مجموعه parameter که objective یکسانی می‌دهند ــ را کاهش دهد.

۴.۴.۱.۲ پاداش‌های sparse در برابر dense

reward در RLHF معمولاً sparse است و فقط در انتهای sequence مشاهده می‌شود. sparse reward از مسائل قدیمی reinforcement learning است. در robotics و حوزه‌های دیگر، reward shaping، curriculum learning، Monte Carlo method و intrinsic motivation برای ایجاد feedback مؤثرتر استفاده می‌شوند.

با این حال sparse reward در RLHF موفق است. supervision دریافت‌شده در step t صرفاً reward همان action نیست، بلکه شکلی از accumulated reward از t تا انتهای sequence است. در نتیجه reward نهایی به stepهای قبلی back-propagate می‌شود و sparse reward عملاً به signal dense تبدیل می‌گردد.

در reward shaping [Ng et al., 1999]:

r′(st,at,st+1) = r(st,at,st+1) + f(st,at,st+1)    (4.64)
f(st,at,st+1) = γΦ(st+1) − Φ(st)    (4.65)

اگر Φ(s)=V(s) باشد:

r′ = r + γV(st+1) − V(st)    (4.66)

این دقیقاً همان فرم advantage/TD error در PPO است و پیوند روش‌های advantage-based با reward shaping را نشان می‌دهد.

دلیل دیگر مناسب‌بودن end-of-sequence reward ماهیت taskهای RLHF است. تصمیم‌گیری زبانی یا شناختی سطح بالا را نمی‌توان همیشه در هر token به‌طور meaningful ارزیابی کرد؛ کیفیت action اغلب تنها با دیدن اثر آن در کل context روشن می‌شود. human feedback نهایی اگرچه sparse است، معمولاً informative و دقیق است و می‌تواند learning را robust و efficient کند.

۴.۴.۱.۳ پاداش‌های ریزدانه

بسیاری از applicationها نیاز دارند بخش‌های مختلف sequence جداگانه ارزیابی شوند. همان‌طور که aspect-based sentiment analysis برای جملهٔ «دوربین گوشی عالی است، اما عمر باتری ناامیدکننده است» sentiment دوربین و باتری را جدا بررسی می‌کند، reward modeling نیز می‌تواند sequence را segment کند.

اگر output y به n_s segment یعنی {ȳ₁,…,ȳ_ns} تقسیم شود:

rk=r(x,y,ȳk)    (4.67)
r(x,y)=Σk=1n_s r(x,y,ȳk)    (4.68)

دشواری آن است که segment-level human preference به‌سادگی در دسترس نیست. در rating problem می‌توان یک LLM قوی prefix قبل و بعد از segment را score کند و score segment را اختلاف آن دو دانست:

s(ȳk)=s(ȳ₁…ȳk)−s(ȳ₁…ȳk−1)    (4.69)
Lrating=−Eȳ_k[(s(ȳk)−r(x,y,ȳk))²]    (4.70)

اگر alignment به classification تبدیل شود ــ مثلاً segment ethical/unethical ــ reward model می‌تواند classification loss داشته باشد. با label ground-truth r̂∈{1,−1}:

Lhinge=max(0,1−r(x,y,ȳk)·r̂)    (4.71)

segmentation می‌تواند fixed-length باشد، یا با sentence boundary، topic shift و ساختار semantic انجام شود؛ حتی می‌توان از LLM برای پیدا کردن natural break استفاده کرد. dynamic segmentation نیز می‌تواند جایی boundary بگذارد که reward score تغییر محسوسی دارد.

۴.۴.۱.۴ ترکیب مدل‌های پاداش

reward model یک proxy برای environment واقعی است و proxy کامل معمولاً وجود ندارد. اگر policy بیش از حد برای proxy ناقص optimize شود، performance واقعی ممکن است افت کند؛ این overoptimization، reward hacking یا reward gaming نام دارد [Stiennon et al., 2020; Gao et al., 2023a]. از منظر قانون Goodhart: «وقتی یک measure به target تبدیل شود، دیگر measure خوبی نیست» [Goodhart, 1984].

ساخت oracle reward model تقریباً ناممکن است؛ راه عملی‌تر، ترکیب چند reward model برای کاهش misalignment میان training objective و true objective است [Coste et al., 2024].

rcombine = (1/N) Σk=1K wk rk(x,y)    (4.72)

ترکیب می‌تواند average وزنی، Bayesian model averaging، fusion network یا multi-objective optimization باشد [Miettinen, 1999; Bishop, 2006]. reward modelهای متنوع را می‌توان از subsetهای مختلف data، data sourceهای متفاوت یا aspectهای مختلف alignment ساخت؛ مثلاً یک مدل factual accuracy و مدل دیگری completeness را ارزیابی کند. همچنین off-the-shelf LLMها می‌توانند با تغییر کم یا بدون تغییر به‌عنوان reward model استفاده شوند؛ چنین رویکردی در برخی taskها نتایج قوی گزارش کرده است [Lambert et al., 2024].

۴.۴.۲ بهینه‌سازی مستقیم ترجیح (Direct Preference Optimization)

Reward-model training فرایند RLHF را نسبت به supervised training پیچیده می‌کند و reward model ضعیف می‌تواند policy learning را شدیداً خراب کند. DPO [Rafailov et al., 2024] reward model صریح را حذف و policy را مستقیماً با preference data optimize می‌کند؛ در نتیجه alignment ظاهری شبیه supervised learning پیدا می‌کند.

شکل 4.10تصویر درون‌خطی شکل 4.10 از کتاب Foundations of Large Language Models؛ توضیح فارسی در زیر شکل آمده است.
شکل ۴.۱۰ — RLHF استاندارد مبتنی بر PPO در برابر DPO. در RLHF preference data ابتدا reward model را آموزش می‌دهد و reward/value سپس policy را هدایت می‌کنند؛ در DPO همان preference data مستقیماً policy را آموزش می‌دهد.

برای derive کردن DPO، loss ساده‌ای برای policy در نظر گرفته می‌شود که reward بالا را تشویق و deviation از reference policy را penalize می‌کند:

θ̃=arg minθ Ex∼DEy∼πθ(·|x)[−r(x,y)+β(logπθ(y|x)−logπθref(y|x))]    (4.73)

در این derivation فقط πθ به θ وابسته است و reward و reference fixed فرض می‌شوند. بازآرایی:

θ̃=arg min E[logπθ(y|x)−log(πθref(y|x) exp((1/β)r(x,y)))]    (4.74)

term دوم unnormalized probability است. normalization factor:

Z(x)=Σy πθref(y|x) exp((1/β)r(x,y))    (4.75)
π*(y|x)=πθref(y|x)exp((1/β)r(x,y))/Z(x)    (4.76)

objective به KL divergence تبدیل می‌شود:

θ̃=arg minθ Ex∼D[KL(πθ(·|x)||π*(·|x))−logZ(x)]    (4.77)

چون logZ(x) مستقل از θ است:

θ̃=arg minθ Ex∼D[KL(πθ(·|x)||π*(·|x))]    (4.78)

راه‌حل optimum:

πθ(y|x)=π*(y|x)=πθref(y|x)exp((1/β)r(x,y))/Z(x)    (4.79)

پس reward را می‌توان از نسبت target/reference نوشت:

r(x,y)=β log(πθ(y|x)/πθref(y|x))+logZ(x)    (4.80)

این expression در Bradley–Terry قرار می‌گیرد. Z(x) برای دو output یکسان است و حذف می‌شود:

Prθ(ya≻yb|x)=Sigmoid[βlog(πθ(ya|x)/πθref(ya|x))−βlog(πθ(yb|x)/πθref(yb|x))]    (4.81)
Ldpo(θ)=−E(x,y_a,y_b)∼D_r[log Prθ(ya≻yb|x)]    (4.82)

این loss از نظر شکل شبیه reward-model loss در RLHF است، اما parameterهای policy را optimize می‌کند نه reward model را. مزیت اصلی DPO سادگی و sample efficiency است: fixed preference dataset کافی است و sampling پرهزینهٔ PPO لازم نیست. DPO را می‌توان offline RL دانست. در مقابل، online RL مانند PPO با exploration و feedback تازه می‌تواند با تغییر environment سازگار شود، strategy جدید پیدا کند و state-action space گسترده‌تری را پوشش دهد؛ این می‌تواند برای generalization LLM مهم باشد.

۴.۴.۳ تولید خودکار دادهٔ ترجیح

human preference data مؤثر اما گران، کم‌مقیاس و subjective است. برای افزایش scalability و consistency می‌توان از AI feedback استفاده کرد. همانند synthetic instruction data، با داشتن inputها ابتدا LLM زوج‌های output می‌سازد و سپس با prompt دیگری preference label هر زوج را تولید می‌کند.

سناریوی خدمات مشتری را در نظر بگیر. دو پاسخ را بررسی و مشخص کن کدام ترجیح دارد. پاسخ خوب باید مؤدبانه، روشن و کوتاه باشد، نگرانی مشتری را مستقیماً پاسخ دهد، اطلاعات یا راه‌حل مفید بدهد و tone مثبت داشته باشد.

Request:
سلام، سفارش من چند روز از زمان تحویل برنامه‌ریزی‌شده گذشته و هنوز نرسیده است. لطفاً وضعیت را اعلام می‌کنید؟

Response A:
برای تأخیر بسیار متأسفم و درک می‌کنم این وضعیت چقدر ناراحت‌کننده است. در حال پیگیری هستیم تا هرچه سریع‌تر حل شود.

Response B:
خب، این چیزها پیش می‌آید! بسته وقتی برسد می‌رسد، نگران نباش.

Response A is preferred.

labelهای preference همراه input و output pair برای reward-model training استفاده می‌شوند. few-shot demonstration، CoT rationale و prompting پیشرفته می‌تواند labeling را بهتر کند. علاوه بر label، probability tokenهای «A» و «B» را می‌توان استخراج، با Softmax normalize و به‌عنوان pointwise supervision استفاده کرد [Lee et al., 2023].

scale کردن synthetic preference آسان است اما accuracy و diversity باید کنترل شود؛ diversity در input، output و annotation مهم است. می‌توان از LLMهای مختلف، promptهای متفاوت و in-context demonstrationهای گوناگون استفاده کرد [Cui et al., 2024]. Dubois et al. [2024] اهمیت variability pairwise preference را برای training از human یا AI feedback گزارش کرده‌اند.

AI feedback برای taskهای well-defined با metric objective مقیاس‌پذیر و نسبتاً consistent است؛ human feedback برای valueها، preferenceهای ظریف و contextهای subjective مزیت دارد. ترکیب هر دو می‌تواند مدل را از insight انسانی و scalability AI هم‌زمان بهره‌مند کند.

۴.۴.۴ هم‌ترازی گام‌به‌گام

تا اینجا reward model عمدتاً کل input-output pair را ارزیابی می‌کرد. برای taskی که correctness نهایی آسان است ــ مثلاً محاسبهٔ expression ــ outcome reward کافی به نظر می‌رسد؛ اما در reasoning پیچیده، تنها دانستن درست/غلط بودن answer نهایی نشان نمی‌دهد کدام step اشتباه بوده است. مشابه دانش‌آموزی که فقط answer نهایی را می‌بیند، مدل به feedback روی فرایند نیاز دارد.

CoT در فصل ۳ reasoning را به intermediate stepها می‌شکند. این ایده به alignment تعمیم می‌یابد. اگر reasoning path برابر y={ȳ₁,…,ȳ_ns} باشد، Uesato et al. [2022] دو خانواده تعریف می‌کنند:

  • Outcome-based: supervision فقط پس از verify شدن نتیجهٔ نهایی؛ policy reward کل r(x,y) را بیشینه می‌کند.
  • Process-based: علاوه بر نتیجهٔ نهایی، همهٔ intermediate stepها supervision دارند و loss از signal مرحله‌ای استفاده می‌کند.
شکل 4.11تصویر درون‌خطی شکل 4.11 از کتاب Foundations of Large Language Models؛ توضیح فارسی در زیر شکل آمده است.
شکل ۴.۱۱ — دو پاسخ LLM به مسئلهٔ ریاضی. در پاسخ ۱ نتیجه و همهٔ reasoning stepها درست‌اند. در پاسخ ۲ answer نهایی درست است اما چند step میانی خطا دارند. outcome-based هر دو را correct می‌بیند؛ process-based می‌تواند errorهای فرایند را در reward modeling لحاظ کند.

جمع‌آوری step-level annotation پرهزینه است، بنابراین انتخاب stepهای informative اهمیت دارد؛ صرفاً annotation همهٔ خطاها لزوماً بهترین استفاده از بودجه نیست و stepهایی که مدل با confidence بالا درست می‌پندارد اما در واقع problem دارند می‌توانند آموزنده‌تر باشند.

با step-level annotated path می‌توان reward model را classification model ساخت: Transformer decoder + Softmax، با labelهایی مانند {correct, incorrect} یا {correct, incorrect, neutral}. در step k، input شامل مسئلهٔ x و reasoning prefix ȳ≤k است. reward کل می‌تواند تعداد stepهای classified-as-correct باشد:

r(x,y)=Σk=1n_s δ(correct,C(x,ȳ≤k))    (4.83)

یا sum log-probability correct label:

r(x,y)=Σk=1n_s log Pr(correct|x,ȳ≤k)    (4.84)

سپس این reward برای policy training در RLHF استفاده می‌شود. این ایده فقط به ریاضی محدود نیست؛ در dialogue می‌توان coherence هر turn را نیز ارزیابی کرد. process-based feedback به fine-grained reward modeling نزدیک است، اما process feedback correctness step را با توجه به preceding steps می‌سنجد، در حالی که fine-grained section غالباً هر segment را مستقل ارزیابی می‌کند.

step-by-step alignment با رشد taskهای reasoning پیچیده اهمیت بیشتری پیدا می‌کند. متن منبع به مدل‌های GPT-o1 و GPT-o3 و long internal CoT برای scientific/math reasoning اشاره می‌کند [OpenAI, 2024]. supervision جزئی روی reasoning path بلند علاوه بر accuracy می‌تواند stepهای redundant را کاهش و efficiency را افزایش دهد.

۴.۴.۵ هم‌ترازی در زمان استنتاج

RLHF و variantهای training-based به fine-tuning نیاز دارند و می‌توانند expensive و unstable باشند. راه دیگر alignment در inference است.

روش ساده Best-of-N sampling (BoN) است: LLM تعداد N candidate می‌سازد و reward model بهترین را انتخاب می‌کند. این شکل reranking سال‌ها در NLP، از جمله machine translation، استفاده شده است و اجازه می‌دهد model ارزیابی پیچیده بدون retraining در pipeline وارد شود.

{ŷ₁,…,ŷN} = argTopNy[Pr(y|x)]    (4.85)
ŷbest = max{r(x,ŷ₁),…,r(x,ŷN)}    (4.86)

candidateها می‌توانند با sampling، beam search یا search algorithm دیگر تولید شوند. کیفیت BoN به diversity فهرست N-best وابسته است. candidateها باید هم high-quality و هم sufficiently different باشند. در text generation تفاوت candidateها گاهی فقط چند واژه است و در LLM ممکن است wording متفاوت اما semantic تقریباً یکسان باشد. با hyperparameterهای generation یا ترکیب LLMهای مختلف می‌توان diversity را افزایش داد، اما میان quality و variation trade-off وجود دارد.

BoN برای training نیز قابل استفاده است. در rejection sampling ابتدا reward model بهترین candidateهای N-best را انتخاب و همان‌ها برای fine-tune کردن LLM استفاده می‌شوند؛ این راهی ساده‌تر از RLHF برای واردکردن human preference به training است [Nakano et al., 2021; Touvron et al., 2023b].

۴.۵ جمع‌بندی

این فصل مجموعه‌ای از تکنیک‌های alignment برای LLM را بررسی کرد، به‌ویژه fine-tuning برای instruction following و human preference alignment. مزیت fine-tuning کارایی محاسباتی است: برخلاف pre-training عظیم، post-training کم‌هزینه‌تر است و برای مسئله‌هایی مانند human value alignment که در pre-training به‌آسانی حل نمی‌شوند مناسب‌تر است. رشد سریع پژوهش alignment پوشش همهٔ روش‌های جدید را دشوار کرده، بنابراین فصل بر رویکردهای بنیادی مانند instruction fine-tuning و RLHF تمرکز داشته است.

AI alignment مفهومی وسیع‌تر از LLM alignment است و به تضمین سازگاری رفتار AI با human values، goals و expectations اشاره دارد. ریشهٔ این نگرانی به سال‌های اولیهٔ AI می‌رسد. Norbert Wiener [Wiener, 1960] هشدار می‌دهد که اگر برای رسیدن به هدف‌هایمان از یک عامل مکانیکی استفاده می‌کنیم که نمی‌توانیم به‌طور مؤثر در عملکردش مداخله کنیم، باید مطمئن باشیم هدفی که در ماشین قرار داده‌ایم همان هدفی است که واقعاً می‌خواهیم.

آن زمان alignment نگرانی دوردستی بود؛ امروز بر طراحی robotهای autonomous، autonomous driving و بسیاری از سامانه‌های AI اثر مستقیم دارد. سامانه باید نه‌تنها ruleهای ظاهری را رعایت کند، بلکه در تصمیم‌های real-time safety انسان، avoidance accident و ethical dilemma را نیز لحاظ کند.

در پژوهش امروز معمولاً یک surrogate objective مشابه goal واقعی ساخته می‌شود و AI به سمت آن هدایت می‌گردد. اما طراحی objective دشوار است، زیرا human valueها متنوع و context-dependent هستند، goalها ممکن است conflict داشته یا در زمان تغییر کنند، و AI حتی با objective ظاهراً درست می‌تواند راه ناخواسته‌ای برای optimize کردن آن پیدا کند که technically goal را برآورده اما harmful یا counterproductive باشد.

همین چالش‌ها پژوهش را به سمت systemهای alignedتر، mechanismهای بهتر برای درک جهان و روش‌های adaptation کارآمدتر و generalizable سوق داده‌اند. با قدرتمندترشدن AI و نشان‌دادن توان چشمگیر LLMها در مسائل دشوار، نیاز به AI alignment فوری‌تر شده و نگرانی‌های AI safety نیز افزایش یافته است. پژوهشگران بر توسعه و انتشار محتاطانهٔ سامانه‌ها برای کاهش misalignment تأکید کرده‌اند [Russell, 2019; Bengio et al., 2024].

امتیاز کاربران به این مقاله

☆☆☆☆☆

0 نفر امتیاز داده اند. میانگین: 0.0 از 5

 

0 نظر

نظر محترم شما در مورد مقاله های وب سایت برنامه نویسی و پایگاه داده

نظرات محترم شما در خدمات رسانی بهتر ما را یاری می نمایند. لطفا اگر مایل بودید یک نظر ما را مهمان فرمائید. آدرس ایمیل و وب سایت شما نمایش داده نخواهد شد.

0 / 500

اطلاعات تماس

  • آدرس:اصفهان-خیابان ام کلثوم غربی - بعد خیابان تخم چی - بیست متر بعد از پیتزا ننه شب - کوچه تعمیر گاه سمار زغالی - پلاک 354 - درب مشکی - طبقه هفتم
  • آدرس ایمیل:najafzade@gmail.com
  • وب سایت:http://www.a00b.com/
  • تلفن ثابت:(+98)9131253620
  • تلفن همراه:09131253620