🧠 آیا مدل‌های هوش مصنوعی واقعاً متن‌های طولانی را درک می‌کنند؟ معرفی WILDTRACE

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در تلاشند تا بفهمند مدل‌های زبانی بزرگ (LLM) چقدر در تحلیل اسناد بسیار طولانی (مثل گزارش‌های فنی یا رمان‌ها) توانمند هستند. اغلب بنچ‌مارک‌های فعلی از داده‌های مصنوعی استفاده می‌کنند که تفاوت زیادی با دنیای واقعی دارند.

بنچ‌مارک جدید WILDTRACE با ۴۸۱ وظیفه مختلف، روی متون واقعی و ساختار طبیعیِ اسناد تمرکز کرده است تا ببیند آیا هوش مصنوعی می‌تواند به طور منطقی شواهد پراکنده در یک متن طولانی را به هم وصل کند یا خیر. این گام بزرگی برای رسیدن به هوش مصنوعی با استدلال‌های دقیق‌تر و عمیق‌تر در دنیای واقعی است.

منبع: arXiv AI