🚀 دستیابی به هوش مصنوعیِ منطقی‌تر با متد جدید TOPD!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانیِ مبتنی بر انتشار (Diffusion LLMs) پتانسیل بالایی دارن، اما آموزشِ تواناییِ «استدلال» در اون‌ها همیشه یه چالش بزرگ بوده.

محققان به تازگی چارچوب جدیدی به اسم TOPD (Trace-based On-policy Distillation) رو معرفی کردن که اجازه میده مدل‌های دیفیوژن بدون نیاز به محاسبات سنگینِ یادگیری تقویتی (RL)، مهارت‌های استدلال ریاضی رو خیلی سریع‌تر و دقیق‌تر یاد بگیرن.

نکته جالب اینجاست که این روش با استفاده از ۴ برابر محاسبات کمتر، تونسته عملکردی مشابه مدل‌های آموزش‌دیده با RL داشته باشه و دقت پاسخ‌دهی به مسائل پیچیده ریاضی رو به شدت بالا ببره. گامی مهم به سمت مدل‌های زبانیِ کارآمدتر و منطقی‌تر! 🧠✨

منبع: arXiv AI