🎨 خداحافظی با متن‌های طولانی؛ معرفی مدل FlowInOne برای تبدیل همه‌چیز به تصویر!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پیشرفت جدید، مدل «FlowInOne» را معرفی کردند که دنیای هوش مصنوعی مولد را متحول می‌کند. برخلاف مدل‌های فعلی که به شدت به ورودی‌های متنی وابسته هستند، این مدل تمام ورودی‌ها—از متن گرفته تا طرح‌های چیدمان و دستورات ویرایشی—را به «تصویر» تبدیل کرده و آن‌ها را در یک جریان یکپارچه پردازش می‌کند.

این یعنی:
✅ حذف پیچیدگی‌های هم‌راستایی بین متن و تصویر
✅ یکپارچگی کامل در تولید، ویرایش و دنبال کردن دستورات تصویری
✅ معرفی دیتاسنت عظیم VisPrompt-5M برای آموزش مدل‌های قدرتمندتر

این مدل جدید با عملکرد فوق‌العاده‌اش در بنچمارک‌های مختلف، قدم بزرگی برای رسیدن به مدل‌های «بصری‌محور» (Vision-centric) برداشته که به جای کلمات، با دنیای بصری بهتر ارتباط برقرار می‌کنند. 🚀✨

منبع: arXiv Computer Vision