🧠 چالش بزرگ مدل‌های زبانی در یادگیری از اشتباهات!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک مطالعه جدید متوجه شدند که روش‌های فعلی آموزش هوش مصنوعی (On-policy distillation) یک ضعف اساسی دارند: مدل‌ها اغلب «توافق در شکست» را یاد می‌گیرند!

🔹 ماجرا چیست؟
وقتی یک مدل کوچک (دانش‌آموز) از یک مدل بزرگ (معلم) تقلید می‌کند، در اکثر مواقع حتی اگر مدل معلم در مسیر اشتباه باشد، مدل کوچک هم همان اشتباه را تکرار می‌کند. این تحقیق نشان می‌دهد که بیش از ۶۷٪ از توکن‌های تولید شده در فرآیند یادگیری، در واقع تقلید از همان شکست‌های مدل معلم است.

این یافته یک زنگ خطر برای توسعه‌دهندگان است که نشان می‌دهد صرفاً تقلید کردن از خروجی‌های مدل‌های بزرگ، لزوماً باعث باهوش‌تر شدن مدل‌های کوچک نمی‌شود و باید به دنبال روش‌های دقیق‌تری برای شناسایی «کجا و چرا» شکست خوردن بود.

منبع: arXiv Machine Learning