محققان در پژوهش جدیدی به بررسی این موضوع پرداختهاند که چگونه میتوان مدلهای زبانی (LLM) را برای تولید مدلهای فرآیندی دقیقتر (مانند BPMN) بهینهسازی کرد.
نکات کلیدی این مطالعه:
✅ بهبود چشمگیر کیفیت نحوی و کاربردی مدلها با استفاده از یادگیری تقویتی.
✅ کاهش بیش از ۶ برابری تنوع خروجیهای نامطلوب.
✅ یافته جالب: وزندهی یکسان به پاداشها، بهتر از تأکید بر جنبههای خاص عمل میکند!
این تحقیق نشان میدهد طراحی «تابع پاداش» در مدلهای زبانی نقش حیاتی در خروجی نهایی دارد و تعامل بین معماری مدل و روشهای بهینهسازی میتواند نتایج کاملاً متفاوتی ایجاد کند.
منبع: arXiv AI
