یکی از چالشهای بزرگ مدلهای زبانی (LLM) هنگام حل مسائل بهینهسازی، این است که مدلها گاهی بدون هیچ هشداری کدهای اشتباه تولید میکنند. اما محققان در یک پژوهش جدید، روش نوآورانهای به نام «Falsification-based Verification» طراحی کردهاند که مثل یک ناظر هوشمند، مدلهای تولیدشده توسط هوش مصنوعی را در حین اجرا بررسی میکند.
این روش جدید بدون نیاز به دیتای آموزشی خاص، صحت مدلهای ریاضی را با استفاده از تستهای منطقی و هندسی ارزیابی میکند و میتواند خطاهایی را شناسایی کند که در روشهای معمول کاملاً پنهان میمانند. این یعنی دقت بالاتر و اعتماد بیشتر به مدلهای هوش مصنوعی در محیطهای صنعتی و علمی! 🚀✨
منبع: arXiv AI
