تا حالا فکر کردید که چطور مدلهای کوچکِ «تقطیر شده» (Distilled)، در بنچمارکها خوب عمل میکنند اما در عمل ضعیف هستند؟ پژوهش جدیدی با عنوان «GenDistill» پرده از یک حقیقت مهم برداشته است: اکثر مدلهای هوش مصنوعی با معیار log-likelihood ارزیابی میشوند، نه «تولید متنِ خودکار» (Autoregressive Generation)!
محققان متوجه شدند که یک مدل ۷ میلیاردی که در تستهای معمولی خیلی نزدیک به مدل اصلی (Teacher) عمل میکند، وقتی نوبت به تولید پاسخ واقعی میرسد، تا ۲۰ درصد افت کیفیت دارد. این یعنی ما در ارزیابی دقت مدلها دچار سوگیری هستیم و باید به سمت معیارهای ارزیابی واقعبینانهتر حرکت کنیم. این مقاله برای توسعهدهندگان LLM که به دنبال بهینهسازی دقیقتر هستند، بسیار حیاتی است.
منبع: arXiv AI
