रास्ता: मॉडल की बाद की ट्रेनिंग कैसे होती है
RL वातावरण क्या है
RL यानी इनाम के संकेत से सीखना: समझें कि कोई काम ऐसा कैसे बनता है जिस पर मॉडल खुद अभ्यास कर सके, और कौन-सा काम इसके लायक नहीं होता।
- शुरुआती स्तर
- थोड़ी बुनियादी समझ
- समय
- 18 मिनट
- सार्वजनिक पाठ मार्गदर्शिका
- EN + हिंदी
आप यह करना सीखेंगे
बताएँ कि कोई काम ऐसा अभ्यास बन सकता है या नहीं जिसे मॉडल खुद चलाए, और क्यों।
यह काम क्यों ज़रूरी है
बाद की ट्रेनिंग वहीं बड़ी हो पाती है जहाँ हर कोशिश को किसी व्यक्ति के पढ़े बिना परखा जा सके।
तीन बातें याद रखें
- काम अभ्यास लायक तब है जब कोई नियम उसे बिना किसी व्यक्ति के अंक दे सके।
- किसी काम को अभ्यास कहने से पहले सफलता की जाँच लिख लें।
- बताएँ कि यह अपने-आप चलने वाली जाँच क्या नहीं देख सकती।
एक उदाहरण देखें
काम
तीन संभावित काम: तारीख बदलना, शोक-संदेश लिखना, विनम्र अभिवादन चुनना।
फैसला खुद करके देखें
दोनों जवाब ऊपर वाले काम के हैं। इनमें से एक बेहतर काम करता है। कौन-सा, और क्यों?
अब खुद बनाकर देखें
अपने काम या पढ़ाई से एक काम चुनें। लिखें कि उसमें क्या दिया जाता है, बिना किसी व्यक्ति के सफलता तय करने वाला ठीक नियम क्या होगा, और वह नियम कौन-सी एक बात नहीं देख सकता।
शुरू करने का आसान तरीकाचार हिस्से: काम, उसमें दी जाने वाली बात, अपने-आप चलने वाली जाँच, और उसकी अनदेखी रह जाने वाली बात।
और गहराई में पढ़ें
स्रोत पढ़ना वैकल्पिक है। पूरी सीख और अभ्यास AI2Bharat के अंदर उपलब्ध है।
मूल या आधिकारिक स्रोत पढ़ें: OpenAI Gym