पाठों पर जाएँ

रास्ता

मॉडल की बाद की ट्रेनिंग कैसे होती है

उदाहरण, पसंद के संकेत, इनाम के संकेत और जाँच कहाँ काम आते हैं, समझें। कोडिंग ज़रूरी नहीं है।

9 पाठ186 मिनट

किस काम के लिए तैयार करता है
यह वे शब्द देता है जो बाकी रास्ते इस्तेमाल करते हैं, ताकि कोई प्रोजेक्ट का विवरण या भूमिका का ब्योरा अनजान शब्दों की दीवार न लगे।
आप क्या सीखेंगे
आप समझते हैं कि लिखे हुए उदाहरण, लोगों की पसंद, इनाम का संकेत और मूल्यांकन मिलकर मॉडल को कैसे बदलते हैं, और स्कोर कैसे बढ़ सकता है जबकि असली काम चुपचाप बिगड़ रहा हो। कोडिंग की ज़रूरत नहीं।
यह क्रम क्यों
यह ट्रेनिंग की प्रक्रिया उसी क्रम में चलती है जिस क्रम में वह असल में होती है, ताकि हर बात अगली बात समझा सके।
  1. उदाहरण और निर्देशित फाइन-ट्यूनिंग (SFT)18 मिनट
  2. पसंद से प्रशिक्षण संकेत तक20 मिनट
  3. अंतिम जाँच चक्र पूरा करती है20 मिनट
  4. RL वातावरण क्या है18 मिनट
  5. इनाम की चालाकी पहचानें20 मिनट
  6. इनाम मॉडल क्या है20 मिनट
  7. सीधी पसंद से सिखाना22 मिनट
  8. आपके निशान कहाँ जाते हैं22 मिनट
  9. पसंद वाले बैच की जाँच करें26 मिनट

पाठ्यक्रम की समीक्षा: