Skip to lesson

യന്ത്രം വിവർത്തനം ചെയ്തതാണ്. ഇംഗ്ലീഷ്, ഹിന്ദി പരിശോധിച്ച പതിപ്പുകളാണ്.Englishहिन्दी

  1. Learn
  2. See
  3. Try
  4. Make

RL പരിസ്ഥിതി എന്താണ്

What this lesson is about

RL എന്നത് ഒരു പ്രതിഫല സിഗ്നലിൽ നിന്ന് പഠിക്കുന്നതിനെ അർത്ഥമാക്കുന്നു. ഒരു ടാസ്ക് എങ്ങനെ ഒരു മോഡൽ സ്വയം അഭ്യാസം നടത്താൻ കഴിയുന്ന ഒന്നായി മാറുന്നു എന്നത് കാണുക, കൂടാതെ ഏത് ടാസ്ക് അനുയോജ്യമല്ലെന്നും മനസിലാക്കുക.

ഒരു ടീം ഒരു മോഡലിന് മൂന്ന് ജോലികൾ സ്വയം പഠിക്കണമെന്ന് ആഗ്രഹിക്കുന്നു: തീയതികൾ തിരിയ്ക്കൽ, അനുശോചന കുറിപ്പ് എഴുതൽ, ഒരു അഭിവാദ്യം തിരഞ്ഞെടുക്കൽ. നിങ്ങൾ ഏത് തിരഞ്ഞെടുക്കും?

Why this matters

പരിശീലനം മാത്രമേ വളരൂ, വിജയമെന്നത് ഓരോ ശ്രമവും ഒരു വ്യക്തി വായിക്കാതെ വിലയിരുത്താനാകുമ്പോഴാണ്.

Read the primary or official source: Towers et al., Gymnasium: A Standard Interface for Reinforcement Learning Environments (arXiv)