دنیای تولید تصاویر با هوش مصنوعی باز هم شاهد یک پیشرفت هیجانانگیز است! محققان با معرفی مدل جدید Nemotron-Labs-Diffusion-Image، چالشهای قدیمی مدلهای «انتشار گسسته» (Discrete Diffusion) را هدف قرار دادهاند.
این مدل با استفاده از دو نوآوری کلیدی، کیفیت و سرعت را متحول کرده است:
1️⃣ مکانیزم ویرایش توکنها: برخلاف مدلهای قدیمی که اجازه تغییر بعد از تولید را نمیدادند، این مدل مثل یک مجسمهساز، توکنها را در حین تولید بازبینی و اصلاح میکند.
2️⃣ تابع هدف GCE: این روش باعث میشود مدل در حین آموزش، سیگنالهای یادگیری بهتری دریافت کند و در کنار بهینهسازی مصرف حافظه گرافیکی (VRAM)، تصاویر باکیفیتتری تولید کند.
این یعنی در آینده نزدیک، ابزارهای تبدیل متن به تصویر، دقیقتر و سریعتر از همیشه خواهند بود! 🚀
منبع: arXiv Computer Vision
