🧠 آیا هوش مصنوعی در تشخیص «اطلاعات نادرست» واقعاً هوشمند است؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

پژوهش جدیدی که به‌تازگی در arXiv منتشر شده، چالش جالبی را در ارزیابی مدل‌های زبانی بزرگ (LLM) مطرح کرده است. محققان متوجه شدند که وقتی از هوش مصنوعی می‌خواهیم مستقیماً درباره احتمال به اشتراک‌گذاری یک خبر توسط انسان پیش‌بینی کند، نتایج همیشه دقیق نیست!

نکته کلیدی اینجاست: مدل‌های زبانی در پیش‌بینی «میزان اعتبار» یک مطلب عملکرد خوبی دارند، اما در پیش‌بینی «تمایل انسان به اشتراک‌گذاری» آن مطلب دچار مشکل می‌شوند. این یعنی سوالی که از مدل می‌پرسیم (نحوه پرسش) می‌تواند به اندازه خودِ هوش مصنوعی در خروجی نهایی تأثیرگذار باشد.

این تحقیق به ما یادآوری می‌کند که برای ارزیابی دقیق‌تر مدل‌ها، همیشه «مستقیم پرسیدن» بهترین راه نیست و گاهی باید از مسیرهای غیرمستقیم به نتایج دقیق‌تری رسید. 💡

منبع: arXiv AI