محققان در مقالهای جدید، مدل جدیدی به نام LaViDa را معرفی کردهاند که با استفاده از «مدلهای نفوذی» (Diffusion Models)، رویکردی متفاوت از مدلهای خودبازگشت (Autoregressive) سنتی مانند LLaVA ارائه میدهد.
ویژگیهای کلیدی LaViDa:
✅ سرعت بسیار بالاتر در استنتاج (حدود ۲ برابر سریعتر در برخی بنچمارکها).
✅ انعطافپذیری بیشتر در کنترل خروجیها.
✅ بهرهگیری از استدلال دوطرفه برای درک بهتر مفاهیم چندوجهی.
این مدل ثابت میکند که ترکیب مدلهای نفوذی با انکودرهای بینایی، میتواند علاوه بر حفظ دقت بالا، چالشهای سرعت و کنترلپذیری را در هوش مصنوعیهای چندوجهی (VLM) حل کند. دنیای هوش مصنوعی هر روز سریعتر و هوشمندتر میشود! 🔥
منبع: arXiv Computer Vision
