🔍 رازِ نهفته در مدل‌های انتشاری (Diffusion Models) فاش شد!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دانشمندان در مقاله‌ای جدید به بررسی ساختار داخلی مدل‌های تولید تصویر پرداخته‌اند تا بفهمند این مدل‌ها دقیقاً چگونه اطلاعات را در خود ذخیره می‌کنند. نتایج این تحقیق نشان می‌دهد:

1️⃣ بخش بزرگی از اطلاعات شبکه عصبی صرف جزئیات دقیق و ریزِ تصویر می‌شود.
2️⃣ ارتباط بین تصاویر و کلاس‌های آن‌ها (مفهوم معنایی)، مستقل از جزئیات ظاهری است.

این مطالعه همچنین توضیح می‌دهد که چرا تکنیک «Classifier-Free Guidance» تا این حد در کیفیت خروجی‌ها موثر است؛ در واقع این روش باعث تقویت ارتباط بین کلمات و محتوای بصری در همان لحظات ابتدایی تولید تصویر می‌شود. دانستن این جزئیات فنی به درک بهترِ دنیای مدل‌های مولد کمک شایانی می‌کند! 🧠✨

منبع: arXiv Machine Learning