पाठ पर जाएँ
  1. समझें
  2. देखें
  3. करें
  4. बनाएँ

सीधी पसंद से सिखाना

यह पाठ किस बारे में है

दोनों रास्ते मिलाकर देखें: अंक देने वाला सिखाकर RL चलाना, या मॉडल को जोड़ी से सीधे बदलना।

संस्था मंडली से कहती है कि अब वह अंक देने वाला नहीं बनाएगी। कमरे में किसी को समझ नहीं आ रहा।

यह काम क्यों ज़रूरी है

पुराना रास्ता आपकी जोड़ियों से अंक देने वाला सिखाता है, फिर RL से मॉडल को उसके हिसाब से सुधारता है। सीधी पसंद से सिखाने का तरीका, जो 2023 में प्रकाशित हुआ, इस बीच वाले कदम को हटा देता है और मॉडल को चुने तथा छोड़े गए उत्तर से सीधे बदलता है। आपके निशान लगाने का तरीका नहीं बदलता। एक आदत ज़रूर महँगी हो जाती है: जिस जोड़ी पर बराबरी का निशान है, वह इस रास्ते को कुछ नहीं देती।

मॉडल की बाद की ट्रेनिंग कैसे होती है: 9 में से पाठ 7आगेआपके निशान कहाँ जाते हैंभाग 2 के आख़िर में आपके काम का नमूना बनता है, जिसे आप भेज सकते हैं

मूल या आधिकारिक स्रोत पढ़ें: Rafailov et al., Direct Preference Optimization (arXiv)