रास्ता: Post-training कैसे काम करता है
Preferences से training signal
समझें कि pairwise choices क्या पकड़ते हैं और guideline या reviewer disagreement में क्या छूट सकता है।
- शुरुआती स्तर
- थोड़ी बुनियादी समझ
- समय
- 20 मिनट
- Public lesson guide
- EN + हिंदी
आप यह करना सीखेंगे
समझाएँ कि preference choices क्या capture करती हैं और disagreement कहाँ adjudication माँगता है।
यह काम क्यों ज़रूरी है
Preference उतनी ही useful है जितना उसका task, rubric, reviewer context और disagreement process।
तीन बातें याद रखें
- Same prompt के comparable responses pair करें।
- सिर्फ A या B नहीं, decisive criterion दर्ज करें।
- Valid disagreement को task-design evidence मानें।
एक example देखें
Two medical reviewers underspecified prompt अलग समझते हैं।
Labels silently average करें।
Ambiguity record करें, prompt या rubric clarify करें और relevant expertise से adjudicate करें।
Disagreement hide करने से noisy labels बनते हैं; cause resolve करने से signal improve होता है।
अब खुद बनाकर देखें
Four-step preference-data flow बनाएँ और one place बताएँ जहाँ bias या ambiguity आ सकती है।
और गहराई में पढ़ें
Source पढ़ना optional है। पूरी teaching और practice AI2Bharat के अंदर उपलब्ध है।
Primary या official source पढ़ें: Hugging Face Alignment Course