تا حالا دقت کردید که هوش مصنوعی گاهی اوقات به جای پرسیدن سوالات دقیق برای رفع ابهام، دچار سردرگمی میشود؟ محققان در مقاله جدیدی، بنچمارک نوآورانهای به نام «RegretBench» معرفی کردهاند که نحوه رفتار مدلهای زبانی (LLM) در گفتگوهای چند مرحلهای را ارزیابی میکند.
این بنچمارک به جای بررسی سادهِ «درست یا غلط بودن جواب»، تحلیل میکند که مدل چطور تصمیم میگیرد چه زمانی سوال بپرسد، چه چیزی بپرسد و کی دست از پرسیدن بردارد. این یعنی گامی بزرگ به سمت هوش مصنوعی که نه تنها باهوشتر، بلکه در تعاملات انسانی بسیار کارآمدتر و دقیقتر عمل میکند! 🎯✨
منبع: arXiv AI
