🧠 تکنیک جدید RG-OPD؛ راهکاری هوشمند برای آموزش دقیق‌تر مدل‌های هوش مصنوعی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال به این فکر کرده‌اید که چطور مدل‌های کوچک‌تر می‌توانند از مدل‌های غول‌آسا یاد بگیرند؟ روش‌های فعلی (Distillation) گاهی اوقات اشتباهات مدل معلم را هم یاد می‌گیرند و دچار خطا می‌شوند.

محققان در مقاله جدید خود متد RG-OPD را معرفی کردند که با استفاده از «بازخورد تاییدکننده» (Verifier Feedback)، به مدل اجازه می‌دهد بفهمد چه زمانی باید به خروجی مدل معلم اعتماد کند و چه زمانی نباید! این یعنی مدل دانش‌آموز می‌تواند ضمن حفظ دقت، خروجی‌های گمراه‌کننده را فیلتر کند.

نتایج این تحقیق نشان می‌دهد که این روش در حوزه‌های کدنویسی و استدلال، عملکرد بسیار بهتری نسبت به روش‌های سنتی دارد. اگر به دنیای آموزش مدل‌های LLM علاقه دارید، کد این ابزار در گیت‌هاب منتشر شده است.

منبع: arXiv AI