محققان چارچوب جدیدی به نام USE (Unified Self-Ensembling) را برای بهبود تطبیق مدلهای بینایی-زبانی (مانند CLIP) در زمان تست معرفی کردند.
این روش که با الهام از متد محبوب TPT طراحی شده، با استفاده از یک استراتژی «خود-تجمعی» (Self-Ensembling) هوشمند، به مدل کمک میکند تا در زمان استنتاج، پیشبینیهای دقیقتر و سازگارتری داشته باشد. این فریمورک نه تنها دقت مدلها را افزایش میدهد، بلکه به عنوان یک راهکار سبک و بدون نیاز به آموزش مجدد (Optimization-free) نیز بسیار کارآمد است.
منبع کد این پروژه برای علاقمندان در گیتهاب قرار گرفته است.
منبع: arXiv Computer Vision
