محققان در یک پیشرفت جدید، مدل «FlowInOne» را معرفی کردند که دنیای هوش مصنوعی مولد را متحول میکند. برخلاف مدلهای فعلی که به شدت به ورودیهای متنی وابسته هستند، این مدل تمام ورودیها—از متن گرفته تا طرحهای چیدمان و دستورات ویرایشی—را به «تصویر» تبدیل کرده و آنها را در یک جریان یکپارچه پردازش میکند.
این یعنی:
✅ حذف پیچیدگیهای همراستایی بین متن و تصویر
✅ یکپارچگی کامل در تولید، ویرایش و دنبال کردن دستورات تصویری
✅ معرفی دیتاسنت عظیم VisPrompt-5M برای آموزش مدلهای قدرتمندتر
این مدل جدید با عملکرد فوقالعادهاش در بنچمارکهای مختلف، قدم بزرگی برای رسیدن به مدلهای «بصریمحور» (Vision-centric) برداشته که به جای کلمات، با دنیای بصری بهتر ارتباط برقرار میکنند. 🚀✨
منبع: arXiv Computer Vision
