Lesson पर जाएँ

रास्ता: Post-training कैसे काम करता है

Preferences से training signal

समझें कि pairwise choices क्या पकड़ते हैं और guideline या reviewer disagreement में क्या छूट सकता है।

शुरुआती स्तर
थोड़ी बुनियादी समझ
समय
20 मिनट
Public lesson guide
EN + हिंदी

आप यह करना सीखेंगे

समझाएँ कि preference choices क्या capture करती हैं और disagreement कहाँ adjudication माँगता है।

यह काम क्यों ज़रूरी है

Preference उतनी ही useful है जितना उसका task, rubric, reviewer context और disagreement process।

तीन बातें याद रखें

  • Same prompt के comparable responses pair करें।
  • सिर्फ A या B नहीं, decisive criterion दर्ज करें।
  • Valid disagreement को task-design evidence मानें।

एक example देखें

काम

Two medical reviewers underspecified prompt अलग समझते हैं।

कमज़ोर तरीका

Labels silently average करें।

बेहतर तरीका

Ambiguity record करें, prompt या rubric clarify करें और relevant expertise से adjudicate करें।

बेहतर तरीका क्यों काम करता है

Disagreement hide करने से noisy labels बनते हैं; cause resolve करने से signal improve होता है।

अब खुद बनाकर देखें

Four-step preference-data flow बनाएँ और one place बताएँ जहाँ bias या ambiguity आ सकती है।

शुरू करने का आसान तरीकाPrompt, response pair, reviewer decision और training use शामिल करें।
इस lesson की practice करें

और गहराई में पढ़ें

Source पढ़ना optional है। पूरी teaching और practice AI2Bharat के अंदर उपलब्ध है।

Primary या official source पढ़ें: Hugging Face Alignment Course