یک بررسی جالب نشان میدهد که وقتی از ۸ مدل زبانی مختلف خواستیم «بهترین ابزار» را انتخاب کنند، نتیجه بسیار عجیب بود! این مدلها در هیچکدام از ۱۶ مورد آزمایش شده، به نظر مشترکی نرسیدند. 🤯
این تحقیق نشان میدهد که دنیای ارزیابی مدلهای هوش مصنوعی (AI Evaluation) همچنان پر از چالش است و هنوز معیار واحد و دقیقی برای انتخاب «بهترین» وجود ندارد. این ناهماهنگی، اهمیت نگاه انتقادی به خروجیهای هوش مصنوعی را بیش از پیش گوشزد میکند.
نظر شما چیست؟ آیا میتوان به انتخاب مدلهای هوش مصنوعی برای کارهای حساس اعتماد کرد؟
منبع: Hacker News AI