Skip to lesson

মেশিন দ্বারা অনূদিত। ইংরেজি এবং হিন্দি পর্যালোচিত সংস্করণ।Englishहिन्दी

  1. Learn
  2. See
  3. Try
  4. Make

সরাসরি পছন্দ প্রশিক্ষণ

What this lesson is about

দুটি পথ তুলনা করুন: একটি স্কোরার প্রশিক্ষণ দিন এবং RL ব্যবহার করুন, অথবা মডেলকে সরাসরি জোড়া থেকে সরান।

একটি প্রতিষ্ঠান আপনার দলের কাছে বলেছে তারা আর এই কাজের জন্য স্কোরার তৈরি করবে না। কেউ বুঝতে পারছে না এর মানে কী।

Why this matters

পুরনো পথ আপনার জোড়া থেকে স্কোরার শেখায়, তারপর RL দিয়ে মডেল উন্নত করে। ২০২৩ সালে প্রকাশিত সরাসরি পছন্দ প্রশিক্ষণ স্কোরার বাদ দিয়ে মডেলকে সরাসরি নির্বাচিত ও প্রত্যাখ্যাত উত্তরের থেকে পরিবর্তন করে। আপনার মার্কিং পদ্ধতি অপরিবর্তিত থাকে। একটি অভ্যাস এখন বেশি ব্যয়বহুল: সমতার মার্ক দেওয়া জোড়া এই পথকে কিছুই দেয় না।

Read the primary or official source: Rafailov et al., Direct Preference Optimization (arXiv)