💡 کشف جدید: چرا مدل‌های بینایی-زبانی (VLM) در دستگاه‌های کوچک باتری‌خور هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش تازه، معمای مصرف انرژی در مدل‌های VLM (مثل مدل‌هایی که در گوشی‌ها یا سخت‌افزارهای لبه استفاده می‌شوند) را حل کردند. برخلاف تصور عمومی که فکر می‌کردند پردازش تصویر عامل اصلی مصرف انرژی است، این تحقیق نشان می‌دهد که:

۱. مصرف برقِ این مدل‌ها تقریباً ثابت است و به پیچیدگی تصویر ربطی ندارد.
۲. عامل اصلی اتلاف انرژی و زمان، «تولید متن» (Output Tokens) است. هر توکن خروجی تا ۳۹ برابر بیشتر از توکن ورودی منابع مصرف می‌کند!
۳. در واقع، هرچه تصویر پیچیده‌تر باشد و مدل متن طولانی‌تری تولید کند، انرژی بیشتری هدر می‌رود.

این یافته‌ها مسیر جدیدی برای بهینه‌سازی هوش مصنوعی روی دیوایس‌های همراه باز می‌کند تا در آینده مصرف انرژی کمتری داشته باشند. 🔋🚀

‌سازی

منبع: arXiv AI