مدلهای چندوجهی (MLLM) معمولاً برای تحلیل صحنههای سهبعدی نیاز به پردازش حجم سنگینی از دادههای ویدئویی دارند که هزینه محاسباتی بالایی دارد. حالا محققان روش جدیدی ارائه دادهاند که بدون نیاز به آموزش اضافی، فقط با شناسایی بخشهای تکراری در فضای سهبعدی (Voxel space) و حذف توکنهای اضافی بهصورت آنلاین، میتواند تا ۵۰٪ از مصرف توکنها کم کند!
این متد که روی مدلهای قدرتمندی مثل Qwen2.5-VL و Qwen3-VL تست شده، گام بزرگی برای اجرای سریعتر و ارزانتر هوش مصنوعی در محیطهای سهبعدی است. ⚡️
بعدی
منبع: arXiv AI
