آیا تا به حال فکر کردهاید که مدلهای زبانی دقیقاً چگونه متوجه میشوند که دو رکورد مختلف به یک موجودیت واحد (مثل یک شخص یا شرکت) اشاره دارند؟ محققان در یک مطالعه جامع با انجام بیش از ۱۲۰۰ آزمایش روی مدلهای خانواده Qwen3، این موضوع را کالبدشکافی کردهاند!
نتایج جالب این پژوهش نشان میدهد:
✅ معماری Cross-encoder معمولاً عملکرد بهتری نسبت به Bi-encoder دارد چون جفترکوردها را همزمان تحلیل میکند.
✅ مدلهای بزرگتر همیشه بهترین گزینه نیستند؛ در واقع، مدلهای کوچکتر در شرایطی که دادهها تغییر میکنند (Distribution shift)، گاهی هوشمندانهتر عمل میکنند.
✅ انتخاب نوعِ مدل (Model Variant) برای دقت نهایی حیاتیتر از صرفاً افزایش اندازه مدل است.
این یافتهها به توسعهدهندگان کمک میکند تا برای پروژههای پردازش داده و پایگاه دادههای هوشمند، مدل بهینهتری را انتخاب کنند. 🚀
منبع: arXiv Machine Learning
