🚀 جهشی نو در بازیابی اطلاعات: معرفی معماری Multimodal CoLRAG-TF

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، راهکاری پیشرفته برای حل یکی از چالش‌های بزرگ سیستم‌های RAG (بازیابی-تولید تقویت‌شده) یعنی کار با اسناد پیچیده و چندرسانه‌ای (PDF) ارائه داده‌اند.

این سیستم جدید با ترکیب چهار روش مختلف شامل:
✅ تعبیه‌های متنی (Dense text embeddings)
✅ تطبیق کلمات کلیدی (BM25)
✅ فیلترینگ سه‌گانه مبتنی بر دانش (Knowledge-graph triples)
✅ شباهت‌های تصویرمحور

توانسته است دقت بازیابی را به شکل چشمگیری افزایش دهد. این معماری به ویژه در تحلیل اسناد متنی-تصویری بسیار موفق عمل کرده و در تست‌های چندمرحله‌ای، بهبود ۷۱ درصدی را نسبت به روش‌های سنتی ثبت کرده است. این دستاورد گام بزرگی برای هوشمندتر کردن پاسخ‌دهی مدل‌های زبانی به سوالات پیچیده در اسناد تخصصی است.

منبع: arXiv Machine Learning