مدلهای زبانی چندوجهی (MLLM) امروزه در درک تصویر و متن فوقالعاده عمل میکنند، اما وقتی صحبت از این میشود که «دقیقاً چرا» یک خروجی خاص را تولید کردهاند، اغلب با مشکل مواجه میشوند.
محققان در مقاله جدیدی، چارچوب ERCR را معرفی کردهاند که به جای تحلیلهای پراکنده، با ترکیب دقیقتر شواهد بصری و حذف نویزهای متنی (Context Interference)، باعث میشود مدلهای بزرگی مثل LLaVA یا Qwen2-VL با دقت بسیار بیشتری دلیل تصمیمگیریهای خود را نشان دهند.
این یعنی در آینده، هوش مصنوعی کمتر دچار «توهم» میشود و ما میتوانیم بهتر بفهمیم که مدل دقیقاً به کدام بخش از تصویر استناد کرده است. قدمی رو به جلو برای شفافیت و اعتماد بیشتر به سیستمهای هوشمند! 🧠✨
منبع: arXiv AI
