محققان در پژوهشی جدید، مدل نوآورانه LaRT (مخفف Latency-Response Theory) را برای ارزیابی دقیقتر مدلهای زبانی بزرگ (LLM) معرفی کردند.
تا پیش از این، ارزیابی هوش مصنوعی بیشتر بر پایه دقت پاسخها بود، اما مدل جدید LaRT علاوه بر دقت، «طول زنجیره فکر» (CoT) و سرعت پاسخدهی را نیز به عنوان فاکتورهای کلیدی برای درک توانایی استدلال مدلها در نظر میگیرد.
این روش که بر پایه نظریه IRT توسعه یافته، به ما کمک میکند تا رتبهبندی واقعیتری از هوش مصنوعیها داشته باشیم و تفاوت مدلهای پیشرفته را فراتر از بنچمارکهای معمولی درک کنیم. این یعنی ارزیابیهای فنی دقیقتر برای بهبود نسل آینده مدلهای زبانی! 🧠✨
منبع: arXiv AI
