Skip to lesson

ਮਸ਼ੀਨ ਦੁਆਰਾ ਅਨੁਵਾਦ ਕੀਤਾ ਗਿਆ। ਅੰਗਰੇਜ਼ੀ ਅਤੇ ਹਿੰਦੀ ਸਮੀਖਿਆ ਕੀਤੇ ਗਏ ਸੰਸਕਰਣ ਹਨ।Englishहिन्दी

  1. Learn
  2. See
  3. Try
  4. Make

RL ਵਾਤਾਵਰਣ ਕੀ ਹੁੰਦਾ ਹੈ

What this lesson is about

RL ਦਾ ਮਤਲਬ ਇਨਾਮ ਦੇ ਸੰਕੇਤ ਤੋਂ ਸਿੱਖਣਾ ਹੈ। ਵੇਖੋ ਕਿ ਕਿਸ ਤਰ੍ਹਾਂ ਕੋਈ ਕੰਮ ਮਾਡਲ ਲਈ ਖੁਦ ਅਭਿਆਸ ਕਰਨ ਯੋਗ ਬਣ ਜਾਂਦਾ ਹੈ, ਅਤੇ ਕਿਹੜਾ ਕੰਮ ਇਸ ਲਈ ਠੀਕ ਨਹੀਂ ਹੁੰਦਾ।

ਇੱਕ ਟੀਮ ਚਾਹੁੰਦੀ ਹੈ ਕਿ ਮਾਡਲ ਤਿੰਨ ਕੰਮ ਆਪਣੇ ਆਪ ਸਿੱਖੇ: ਤਾਰੀਖਾਂ ਨੂੰ ਉਲਟਣਾ, ਸਹਾਨੁਭੂਤੀ ਦੇ ਨੋਟ ਲਿਖਣਾ, ਸਲਾਮ ਚੁਣਨਾ। ਤੁਸੀਂ ਕਿਹੜਾ ਚੁਣੋਗੇ?

Why this matters

ਟ੍ਰੇਨਿੰਗ ਸਿਰਫ਼ ਓਥੇ ਵਧਦੀ ਹੈ ਜਿੱਥੇ ਸਫਲਤਾ ਨੂੰ ਬਿਨਾਂ ਕਿਸੇ ਵਿਅਕਤੀ ਦੇ ਪੜ੍ਹਨ ਦੇ ਮਾਪਿਆ ਜਾ ਸਕਦਾ ਹੈ।

Read the primary or official source: Towers et al., Gymnasium: A Standard Interface for Reinforcement Learning Environments (arXiv)