🚀 بهینه‌سازی هوشمند: آموزش مدل‌های قوی با کمک مدل‌های ضعیف!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال فکر کرده‌اید که چطور می‌توان بدون هزینه‌های سنگینِ محاسباتی، مدل‌های بزرگ هوش مصنوعی را آموزش داد؟ محققان در مقاله جدیدی روشی به نام Direct-OPD معرفی کرده‌اند که انقلابی در این مسیر ایجاد می‌کند.

در این روش، به‌جای اینکه مدل‌های غول‌پیکر را از ابتدا با هزینه‌های گزاف آموزش دهیم، از دانشِ مدل‌های کوچک‌تر (که قبلاً با روش‌های تقویتی یا RL آموزش دیده‌اند) استفاده می‌کنیم تا مدل‌های بزرگ‌تر را تقویت کنیم.

نتایج فوق‌العاده است: مثلاً مدل Qwen3-1.7B تنها در ۴ ساعت و با استفاده از ۸ پردازنده A100، جهشی چشمگیر در دقتِ حل مسائل ریاضی (AIME 2024) داشته است! این یعنی راه برای توسعه سریع‌تر و ارزان‌ترِ مدل‌های پیشرفته هموارتر شده است. 💡

منبع: arXiv AI