🚀 بهینه‌سازی خیره‌کننده در پاسخ‌دهی سه‌بعدی؛ ۵۰٪ پردازش کمتر با روشی هوشمند!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های چندوجهی (MLLM) معمولاً برای تحلیل صحنه‌های سه‌بعدی نیاز به پردازش حجم سنگینی از داده‌های ویدئویی دارند که هزینه محاسباتی بالایی دارد. حالا محققان روش جدیدی ارائه داده‌اند که بدون نیاز به آموزش اضافی، فقط با شناسایی بخش‌های تکراری در فضای سه‌بعدی (Voxel space) و حذف توکن‌های اضافی به‌صورت آنلاین، می‌تواند تا ۵۰٪ از مصرف توکن‌ها کم کند!

این متد که روی مدل‌های قدرتمندی مثل Qwen2.5-VL و Qwen3-VL تست شده، گام بزرگی برای اجرای سریع‌تر و ارزان‌تر هوش مصنوعی در محیط‌های سه‌بعدی است. ⚡️

‌بعدی

منبع: arXiv AI