Skip to lesson

মেচিনে অনুবাদ কৰা হৈছে। ইংৰাজী আৰু হিন্দী পৰ্যালোচনা কৰা সংস্কৰণ।Englishहिन्दी

  1. Learn
  2. See
  3. Try
  4. Make

প্ৰত্যক্ষ পছন্দৰ প্ৰশিক্ষণ

What this lesson is about

দুটা পথ তুলনা কৰক: এজন স্কোৰাৰ প্ৰশিক্ষণ দিয়ক আৰু RL ব্যৱহাৰ কৰক, অথবা মডেলটো সোজাকৈ যুগলৰ পৰা সলনি কৰক।

এটা প্ৰতিষ্ঠানে আপোনাৰ দলক কয় যে এতিয়া এই কামৰ বাবে স্কোৰাৰ নুবনাম। কোঠাত কোনোবাই বুজি নাপায়।

Why this matters

পুৰণি পথত আপোনাৰ যুগলৰ পৰা এজন স্কোৰাৰ প্ৰশিক্ষণ দিয়া হয়, তাৰ পিছত RL ব্যৱহাৰ কৰি মডেল উন্নত কৰা হয়। ২০২৩ চনত প্ৰকাশিত প্রত্যক্ষ পছন্দৰ প্ৰশিক্ষণে স্কোৰাৰ বাদ দিয়ে বাচনি কৰা আৰু বর্জিত উত্তৰৰ পৰা মডেল সোজাকৈ সলনি কৰে। আপোনাৰ চিহ্নিতকৰণ পদ্ধতি সলনি নহয়। এটা অভ্যাস এতিয়া বেছি মূল্যবান: সমান নম্বৰৰ যুগলে এই পথত একো নিদিয়ে।

Read the primary or official source: Rafailov et al., Direct Preference Optimization (arXiv)