شاید برایتان پیش آمده باشد که مدلهای زبانی در مقالات علمی، منابعی را به اشتباه «هذیان» یا همان Hallucinate کنند. حالا پژوهشگران بنچمارک جدیدی به نام HALLMARK طراحی کردهاند تا دقت مدلها را در استناد به منابع بسنجند.
نکته کلیدی این تحقیق؟ مشکل اصلی مدلهای فعلی فقط «نداشتن دانش» نیست، بلکه نرخ «مثبت کاذب» (False Positive) بالاست؛ یعنی مدلها گاهی ارجاعات درست را هم به اشتباه زیر سوال میبرند. این ابزار به محققان کمک میکند تا بفهمند کدام مدلها در دنیای آکادمیک قابل اعتمادترند.
این یک قدم مهم برای واقعیتر کردن خروجیهای علمی LLMهاست. نظر شما چیست؟ آیا به ارجاعات هوش مصنوعی اعتماد دارید؟
منبع: arXiv AI
