🚀 بهینه‌سازی دقیق‌تر مدل‌های زبانی با متد جدید CPO 🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای تازه، روشی نوآورانه به نام «بهینه‌سازی سیاست تقابلی» (CPO) را برای حل یکی از چالش‌های بزرگ یادگیری تقویتی یعنی «ابهام در پاداش‌ها» معرفی کرده‌اند.

تا پیش از این، استفاده از «آنتروپی» برای هدایت مدل‌ها، گاهی باعث سردرگمی آن‌ها می‌شد. اما CPO با استفاده از مقایسه هوشمندانه بین توزیع‌های خروجی، تفاوت بین «عدم قطعیت مفید» و «خطای محض» را درک می‌کند. نتیجه این کار، مدلی است که بسیار دقیق‌تر آموزش می‌بیند و در سناریوهای مختلف، عملکردی فوق‌العاده پایدارتر از روش‌های قدیمی نشان می‌دهد. این قدم بزرگی برای کاهش توهمات (Hallucinations) در مدل‌های زبانی است! ✨

منبع: arXiv Machine Learning