دنیای مدلهای زبانیِ مبتنی بر انتشار (Diffusion Language Models) هر روز جذابتر میشود! محققان بهتازگی مدل جدیدی به نام LaViDa-R1 معرفی کردهاند که فراتر از تولید تصویر، در «استدلال چندوجهی» (Multimodal Reasoning) انقلابی به پا کرده است.
💡 چرا این مدل خاص است؟
برخلاف مدلهای قبلی که برای هر کار به آموزش جداگانه نیاز داشتند، LaViDa-R1 با یک فریمورک یکپارچه، همزمان مهارتهای درک بصری، استدلال ریاضی و حتی ویرایش تصاویر را یاد گرفته است. استفاده از تکنیکهایی مثل «جستجوی درختی» در فرآیند آموزش، باعث شده این مدل در تحلیلهای پیچیده و دقیق بسیار توانمندتر عمل کند.
بهنظر میرسد مدلهای dLLM در حال تبدیل شدن به رقبای جدی برای مدلهای متنی مرسوم هستند! نظر شما چیست؟ آیا این نسل جدید جایگزین مدلهای فعلی خواهد شد؟
منبع: arXiv Computer Vision
