🔍 چرا بنچمارک‌های فعلی در ارزیابی هوش مصنوعی گول‌زننده هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا حالا فکر کردید که چطور مدل‌های کوچکِ «تقطیر شده» (Distilled)، در بنچمارک‌ها خوب عمل می‌کنند اما در عمل ضعیف هستند؟ پژوهش جدیدی با عنوان «GenDistill» پرده از یک حقیقت مهم برداشته است: اکثر مدل‌های هوش مصنوعی با معیار log-likelihood ارزیابی می‌شوند، نه «تولید متنِ خودکار» (Autoregressive Generation)!

محققان متوجه شدند که یک مدل ۷ میلیاردی که در تست‌های معمولی خیلی نزدیک به مدل اصلی (Teacher) عمل می‌کند، وقتی نوبت به تولید پاسخ واقعی می‌رسد، تا ۲۰ درصد افت کیفیت دارد. این یعنی ما در ارزیابی دقت مدل‌ها دچار سوگیری هستیم و باید به سمت معیارهای ارزیابی واقع‌بینانه‌تر حرکت کنیم. این مقاله برای توسعه‌دهندگان LLM که به دنبال بهینه‌سازی دقیق‌تر هستند، بسیار حیاتی است.

منبع: arXiv AI