مدلهای خودرگرسیو بصری (VAR) معمولاً به دلیل تعداد بالای توکنها بسیار سنگین و کند هستند، اما محققان به تازگی چارچوب نوآورانهای به نام NOVA را معرفی کردهاند که این مشکل را به شکلی هوشمندانه حل میکند.
این روشِ «بدون نیاز به آموزش» (Training-free)، با تحلیل آنتروپی توکنها در لحظه، تصمیم میگیرد که کدام بخشها واقعاً برای تولید خروجی مهم هستند و با حذف توکنهای کماهمیت، سرعت پردازش را به شدت افزایش میدهد. این یعنی بدون کاهش کیفیت تصویر، شاهد عملکردی سریعتر و بهینهتر خواهیم بود! ⚡️
منبع: arXiv Computer Vision
