یکی از چالشهای بزرگ در سیستمهای بازیابی اطلاعات (RAG)، وجود دادههای تکراری در پایگاه داده برداری است که باعث کندی و کاهش دقت میشود. محققان به تازگی روشی به نام «Cross-Attention Calibrated Deduplication» یا CACD معرفی کردهاند که به جای مقایسههای ساده برداری، از مکانیسم «توجه متقابل» (Cross-Attention) استفاده میکند.
این روش با حفظ جزئیات دقیق توکنها، متون تکراری را بسیار هوشمندانهتر از روشهای سنتی شناسایی و حذف میکند. در آزمایشها، این تکنیک توانست حدود ۱۰ درصد از دادههای زائد را حذف کند، بدون اینکه دقت مدل کاهش یابد. ابزاری عالی برای توسعهدهندگانی که به دنبال افزایش سرعت و کارایی در سیستمهای هوش مصنوعی خود هستند! 🛠️💡
منبع: arXiv Machine Learning
