🚀 هوش مصنوعی، خودش را ارزیابی می‌کند! معرفی «LLM-as-a-Verifier»

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در دستاورد جدیدی، مفهوم «تأیید و راستی‌آزمایی» را به عنوان محور جدیدی برای افزایش دقت مدل‌های زبانی (LLM) معرفی کرده‌اند.

این چارچوب نوآورانه به مدل اجازه می‌دهد بدون نیاز به آموزش مجدد، با استفاده از امتیازدهی احتمالی (به جای امتیازدهی قطعی)، بازخوردهای بسیار دقیق‌تری درباره درستی پاسخ‌هایش ارائه دهد. این یعنی دقت بالاتر در حل مسائل پیچیده و وظایف عامل‌محور (Agentic tasks)!

نتایج اولیه این مدل در بنچمارک‌های معتبری مثل SWE-Bench، عملکردی خیره‌کننده را نشان داده است.

منبع: arXiv AI