محققان در پژوهشی جدید نشان دادند که مدلهای زبانی کوچک (Tiny Language Models) با پارامترهای زیر ۳ میلیارد، اگر به درستی آموزش ببینند، میتوانند با مدلهای غولپیکری مثل GPT-4 در وظایف چندگزینهای رقابت کنند!
نکته کلیدی این تحقیق، استفاده از روش «Fine-tuning مبتنی بر Classification-head» روی مدلهای خانواده Qwen3 است. این روش باعث شده مدلهای بسیار سبک و قابل اجرا روی گوشیهای معمولی، نه تنها در بنچمارکهای مختلف بدرخشند، بلکه در برخی موارد عملکردی بهتر از مدلهای ۱۷۵ میلیارد پارامتری ثبت کنند.
این خبر یعنی آینده هوش مصنوعی لزوماً در مدلهای عظیم نیست؛ بلکه بهینهسازی دقیق میتواند قدرت پردازشی فوقالعادهای را به دستگاههای شخصی ما بیاورد. 📱✨
منبع: arXiv AI
