Skip to lesson

ମେସିନ୍ ଅନୁବାଦ। ଇଂରାଜୀ ଏବଂ ହିନ୍ଦୀ ସମୀକ୍ଷିତ ସଂସ୍କରଣ ଅଟେ।Englishहिन्दी

3 sections show the reviewed English text because a ଓଡ଼ିଆ translation was not available for it.

  1. Learn
  2. See
  3. Try
  4. Make

What a reward model is

What this lesson is about

ଚିହ୍ନିତ ଯୁଗଳରୁ କ’ଣ ତିଆରି ହୁଏ ଦେଖନ୍ତୁ: ଏକ scorer, ଯାହା ସଠିକ୍ ଉତ୍ତର ନୁହେଁ, ଆପଣଙ୍କର କ୍ରମ ଉପରେ ଶିକ୍ଷିତ।

ଆପଣଙ୍କର ୮୦୦ ଚିହ୍ନିତ ଯୁଗଳର ବ୍ୟାଚ୍ ସୋମବାର ଏକ ପରୀକ୍ଷାଗୃହକୁ ଯାଉଛି। ଏକ ସହଯୋଗୀ ପଚାରେ ଯେ ସେଠାରେ ଏହାରୁ କ’ଣ ତିଆରି ହୁଏ।

Why this matters

ପ୍ରକାଶିତ ସାରାଂଶ ଚାଳନାରେ ଏହି ଗଠନ ଦେଖାଯାଏ। ଚିହ୍ନିତ ଯୁଗଳ scorer କୁ ଶିଖାଏ, ଏବଂ ପରେ ମଡେଲ୍ ସେହି scorer ଅନୁସାରେ ସୁଧାରିତ ହୁଏ। ତେଣୁ ଆପଣଙ୍କର ଯୁଗଳ ମଡେଲ୍ ନକଲ କରିବାକୁ ଚାହୁଁଥିବା ଉତ୍ତର ନୁହେଁ। ଏହା scorer ର ନିଜ ଶିକ୍ଷାର ଗୋଟିଏ ପଙ୍କ୍ତି, ଏବଂ ପରେ ମଡେଲ୍ ସେହି scorer କୁ ପ୍ରସନ୍ନ କରିବା ପାଇଁ ପ୍ରେରିତ ହୁଏ।

Read the primary or official source: Stiennon et al., Learning to summarize from human feedback (arXiv)