مدلهای زبانی بزرگ (LLM) گاهی دچار «توهم» میشوند و اطلاعات غلط تولید میکنند. حالا محققان فریمورک جدیدی به نام MMGraphRAG معرفی کردهاند که این مشکل را به روشی هوشمندانه حل میکند!
🔹 این سیستم چطور کار میکند؟
این مدل با ترکیب دانش متنی و دادههای بصری (به صورت گرافهای صحنه)، یک ساختار یکپارچه میسازد. با روش جدیدی به نام «SpecLink»، این مدل میتواند محتوای تصویری و متنی را به هم پیوند بزند تا در زمان پرسش و پاسخ، استدلال بسیار دقیقتر و ساختاریافتهتری ارائه دهد.
✅ چرا اهمیت دارد؟
در سناریوهای پیچیده که نیاز به تحلیل همزمان تصویر و متن است، MMGraphRAG ثابت کرده که نه تنها دقیقتر عمل میکند، بلکه قدرت استدلال مدلهای هوش مصنوعی را به سطح بالاتری میبرد.
منبع: arXiv AI
