🚀 فراتر از امتیازدهی عددی: مدل‌های زبانی به‌عنوان «مربی» وارد می‌شوند! 🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی رویکردی نوآورانه به نام «یادگیری تجربی» (Experiential Learning) را معرفی کرده‌اند که نحوه آموزش LLMها را دگرگون می‌کند.

تا پیش از این، ارزیابی مدل‌ها اغلب به امتیازهای عددی ساده خلاصه می‌شد که باعث می‌شد بازخوردهای متنی ارزشمند نادیده گرفته شوند. اما حالا، مدل هوش مصنوعی به جای یک «داور» (Judge)، در نقش یک «مربی» (Coach) عمل می‌کند. این مربی، بازخوردها را به دانش تجربی تبدیل کرده و آن را به مدل تزریق می‌کند.

این روش نه تنها باعث دقت بیشتر و درک بهتر ظرافت‌های زبانی می‌شود، بلکه مشکل «پاداش‌دهی کاذب» (Reward Hacking) را نیز تا حد زیادی کاهش می‌دهد. قدمی بزرگ به سمت مدل‌هایی که واقعاً «می‌آموزند» نه فقط «حفظ می‌کنند»! 💡

منبع: arXiv Machine Learning