Skip to lesson

இயந்திர மொழிபெயர்ப்பு. ஆங்கிலம் மற்றும் ஹிந்தி மதிப்பாய்வு செய்யப்பட்ட பதிப்புகள்.Englishहिन्दी

1 section shows the reviewed English text because a தமிழ் translation was not available for it.

  1. Learn
  2. See
  3. Try
  4. Make

What a reward model is

What this lesson is about

குறிப்பிடப்பட்ட ஜோடிகளிலிருந்து என்ன உருவாக்கப்படுகிறது என்று பாருங்கள்: ஒரு scorer, சரியான பதிலுக்கு பதிலாக உங்கள் வரிசையில் பயிற்சி பெறுகிறது.

உங்கள் எட்டு நூறு குறிப்பிட்ட ஜோடிகளின் தொகுப்பு திங்கட்கிழமை ஒரு ஆய்வகத்திற்கு செல்கிறது. அங்கு அதிலிருந்து என்ன உருவாக்கப்படுகிறது என்று ஒரு தோழர் கேட்கிறார்.

Why this matters

ஒரு வெளியிடப்பட்ட சுருக்கம் ஓட்டத்தில் இதே வடிவம் காணப்படுகிறது. குறிப்பிட்ட ஜோடிகள் scorer ஐ பயிற்சி அளிக்கின்றன, பின்னர் மாதிரி அந்த scorer ஐ மேம்படுத்துகிறது. எனவே உங்கள் ஜோடி மாதிரி நகலெடுக்கக்கூடிய பதில் அல்ல. அது scorer இன் கற்றல் வரிசையில் ஒரு வரி மட்டுமே. பின்னர் மாதிரி அந்த scorer ஐ மகிழச் செய்யத் தள்ளப்படுகிறது.

Read the primary or official source: Stiennon et al., Learning to summarize from human feedback (arXiv)