🚀 نوآوری در معماری مدل‌های زبانی: معرفی PreDiff-LM

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، تکنیک نوآورانه‌ای به نام «PreDiff-LM» را معرفی کرده‌اند که پل ارتباطی میان مدل‌های زبانیِ «خود-بازگشتی» (Autoregressive) و مدل‌های «انتشار گسسته» (Discrete Diffusion) است.

💡 این مدل با استفاده از یک مکانیزم «توجه ترکیبی» (Hybrid Attention)، به مدل‌های زبانی اجازه می‌دهد که ضمن حفظ قابلیت‌های پیش‌بینی متن، از توانایی‌های مدل‌های انتشاری برای تولید دوطرفه و پر کردن جای خالی کلمات (Infilling) بهره ببرند.

چرا این موضوع مهم است؟
این رویکرد نه تنها کیفیت تولید متن و دقت مدل را بهبود می‌بخشد، بلکه سرعت همگرایی مدل‌های از پیش آموزش‌دیده را نیز به شکل چشمگیری افزایش می‌دهد. قدمی رو به جلو برای مدل‌هایی که می‌خواهند هم «دقیق» باشند و هم «هوشمندتر» درک کنند.

منبع: arXiv AI