آیا هوش مصنوعی میتواند به شکلی قابلاعتماد، خروجیهای سایر مدلها را قضاوت کند؟ محققان بهتازگی گامی مهم در این زمینه برداشتهاند.
مدلهای زبانی چندوجهی (MLLM) امروزه به عنوان «داور» برای ارزیابی عملکرد دیگر مدلها استفاده میشوند، اما اغلب در تشخیص دقیق و بیطرفانه دچار چالش هستند. در این پژوهش، چارچوب جدیدی به نام M-JudgeBench معرفی شده که تواناییهای قضاوتی مدلها را در ۱۰ حوزه مختلف میسنجد.
همچنین با استفاده از روش خلاقانه «Judge-MCTS»، محققان مدلهای جدیدی به نام M-Judger آموزش دادهاند که در ارزیابیها بسیار دقیقتر و منطقیتر از مدلهای فعلی عمل میکنند. این یعنی مسیر برای داشتن سیستمهای ارزیابی هوش مصنوعیِ قابلاعتمادتر، هموارتر شده است! 🧠✨
منبع: arXiv AI
