محققان در یک مطالعه جدید متوجه شدند که روشهای فعلی آموزش هوش مصنوعی (On-policy distillation) یک ضعف اساسی دارند: مدلها اغلب «توافق در شکست» را یاد میگیرند!
🔹 ماجرا چیست؟
وقتی یک مدل کوچک (دانشآموز) از یک مدل بزرگ (معلم) تقلید میکند، در اکثر مواقع حتی اگر مدل معلم در مسیر اشتباه باشد، مدل کوچک هم همان اشتباه را تکرار میکند. این تحقیق نشان میدهد که بیش از ۶۷٪ از توکنهای تولید شده در فرآیند یادگیری، در واقع تقلید از همان شکستهای مدل معلم است.
این یافته یک زنگ خطر برای توسعهدهندگان است که نشان میدهد صرفاً تقلید کردن از خروجیهای مدلهای بزرگ، لزوماً باعث باهوشتر شدن مدلهای کوچک نمیشود و باید به دنبال روشهای دقیقتری برای شناسایی «کجا و چرا» شکست خوردن بود.
منبع: arXiv Machine Learning
