تا به حال فکر کردهاید که چطور میتوان بدون هزینههای سنگینِ محاسباتی، مدلهای بزرگ هوش مصنوعی را آموزش داد؟ محققان در مقاله جدیدی روشی به نام Direct-OPD معرفی کردهاند که انقلابی در این مسیر ایجاد میکند.
در این روش، بهجای اینکه مدلهای غولپیکر را از ابتدا با هزینههای گزاف آموزش دهیم، از دانشِ مدلهای کوچکتر (که قبلاً با روشهای تقویتی یا RL آموزش دیدهاند) استفاده میکنیم تا مدلهای بزرگتر را تقویت کنیم.
نتایج فوقالعاده است: مثلاً مدل Qwen3-1.7B تنها در ۴ ساعت و با استفاده از ۸ پردازنده A100، جهشی چشمگیر در دقتِ حل مسائل ریاضی (AIME 2024) داشته است! این یعنی راه برای توسعه سریعتر و ارزانترِ مدلهای پیشرفته هموارتر شده است. 💡
منبع: arXiv AI
