اگر فکر میکردید برای اجرای مدلهای بینایی-زبانی در رباتیک به سختافزارهای فوقسنگین نیاز دارید، مدل جدید TurboVLA معادلات را عوض کرده است!
🔹 این مدل به جای تکیه بر مدلهای زبانی بزرگ (LLM) که بار محاسباتی زیادی دارند، از یک معماری مستقیم (V+L to A) استفاده میکند. نتیجه؟ اجرای بینظیر با نرخ ۳۲ فریم بر ثانیه روی کارت گرافیک RTX 4090 با کمتر از ۱ گیگابایت حافظه VRAM!
این یعنی هوش مصنوعیِ رباتیک میتواند سریعتر، سبکتر و بسیار کارآمدتر از قبل عمل کند. گامی بزرگ برای هوشمندتر شدنِ بازوهای رباتیک در دنیای واقعی. 🤖✨
منبع: arXiv Computer Vision
