🧠 گامی نو در پیوند مدل‌های زبانی و بصری با dRAE

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، مدل «dRAE» را معرفی کرده‌اند که تحولی در نحوه پردازش تصاویر و تبدیل آن‌ها به داده‌های گسسته ایجاد می‌کند.

مشکل اصلی مدل‌های فعلی، ناهماهنگی در فضای هندسی ویژگی‌هاست که باعث افت کیفیت می‌شود. این مدل جدید با استفاده از تکنیک «کوآنتیزاسیون ابرکروی» (HSQ)، محتوای معنایی را از مقیاس ویژگی‌ها جدا می‌کند تا مدل بتواند در مقیاس‌های بسیار بزرگ (تا بیش از ۱۳۰ هزار واژه) بدون افت کیفیت عمل کند.

این دستاورد، پلی مهم برای یکپارچگی بهتر مدل‌های بینایی-زبانی (VLM) است و دقت بازسازی تصاویر را به شدت افزایش می‌دهد.

منبع: arXiv AI