همیشه اجرای مدلهای سنگین بینایی-زبانی (VLM) روی پردازندههای عصبی (NPU) به دلیل محدودیتهای سختافزاری با چالشهای زیادی همراه بوده است. حالا محققان با معرفی معماری «AutoNeural» این مشکل را حل کردهاند.
ویژگیهای کلیدی این نوآوری:
✅ جایگزینی لایههای سنگین Vision Transformer با یک backbone سبک شبیه MobileNetV5 برای بهینهسازی دقیق.
✅ استفاده از مدلهای حالت-فضا (SSM) برای افزایش سرعت پردازش و حذف نیاز به کش کردن حافظه.
✅ بهبود چشمگیر: کاهش ۷ برابری خطای کوانتایزیشن و افزایش ۱۴ برابری سرعت در مقایسه با مدلهای فعلی!
این معماری با تست روی چیپستهای خودرویی مثل Qualcomm SA8295P ثابت کرده که میتواند دنیای هوش مصنوعیِ روی دستگاههای همراه و خودروهای هوشمند را متحول کند. 🚗⚡️
منبع: arXiv NLP
