🚀 جهش در توانایی استدلال مدل‌های زبانی: معرفی OPD²!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی، تکنیک نوآورانه‌ای به نام «On-Policy Delta Distillation» یا به اختصار OPD² ارائه کرده‌اند که نحوه آموزش و بهینه‌سازی مدل‌های زبانی (LLMs) را متحول می‌کند.

🔹 این روش چیست؟
در متدهای معمول، مدل‌ها سعی می‌کنند از خروجی نهایی مدل‌های بزرگ‌تر تقلید کنند. اما در این روش جدید، تمرکز روی «سیگنال دلتا» است؛ یعنی تفاوت بین مدل پایه و مدل آموزش‌دیده برای استدلال. این کار باعث می‌شود مدل‌های هوش مصنوعی خیلی سریع‌تر و دقیق‌تر، توانمندی‌های منطقی، ریاضی و کدنویسی را یاد بگیرند.

این یعنی در آینده‌ای نزدیک، مدل‌های کوچک‌تر با زمان آموزش کوتاه‌تر، در حل مسائل پیچیده عملکردی به مراتب بهتر خواهند داشت.

🔗 جزئیات بیشتر و دسترسی به کد

منبع: arXiv Machine Learning