محققان با معرفی مدل جدید SenseNova-Vision، رویکردی متفاوت برای بینایی ماشین ارائه کردهاند. در این متد، برخلاف مدلهای سنتی که برای هر کار خاص (مثل تشخیص شیء یا بخشبندی) به معماری جداگانه نیاز دارند، تمام وظایف بینایی در یک ساختار «مولتیمودال یکپارچه» تعریف میشوند.
این مدل میتواند با دستورات متنی و بصری، خروجیهای متنوعی از متن تا تصاویر دقیق تولید کند. از تشخیص متن در تصاویر (OCR) گرفته تا تخمین عمق و ژست دوربین، همگی در یک مدل واحد خلاصه شدهاند. این یعنی گامی بزرگ به سوی مدلهای بصریِ همه فن حریف و بدون نیاز به معماریهای پیچیده و تخصصی! 🚀✨
منبع: arXiv Computer Vision
