محققان مدل هوشمند جدیدی به نام Lavida-O را معرفی کردهاند که مرزهای فهم و تولید محتوا را جابهجا کرده است. این مدل برخلاف نمونههای قبلی، نه تنها در درک تصاویر و مکانیابی اشیاء فوقالعاده عمل میکند، بلکه میتواند تصاویر با کیفیت بالا (1024px) تولید کرده و آنها را ویرایش کند.
ویژگیهای کلیدی Lavida-O:
🔹 معماری نوآورانه Elastic-MoT برای ترکیب کارایی و قدرت.
🔹 توانایی برنامهریزی و خود-اصلاحی در زمان ویرایش تصاویر.
🔹 عملکرد خیرهکننده در بنچمارکهای جهانی، حتی سریعتر و دقیقتر از مدلهای مشهوری مثل Qwen2.5-VL.
این مدل یک قدم بزرگ به سوی هوش مصنوعی چندوجهی یکپارچه است که هم درک عمیقی دارد و هم خلاقیت بالایی در تولید محتوا!
منبع: arXiv Computer Vision
