محققان در مقالهای جدید، رویکردی متفاوت برای «تقطیر دادهها» (Dataset Distillation) معرفی کردهاند که به جای تقلید از فرآیند آموزش، مستقیماً بر خروجی نهایی تمرکز دارد. متد جدیدی به نام Inf-Match با استفاده از یک تخمینگر نفوذ (Influence Estimator)، یک نسخه بسیار فشرده از دادهها را میسازد که تأثیری مشابه کل مجموعه داده اصلی روی مدل دارد.
ویژگیهای کلیدی این روش:
✅ سرعت بالا و بدون نیاز به محاسبات سنگین ریاضی (مانند معکوس هسیان).
✅ عملکرد خیرهکننده در بنچمارکهای طبقهبندی تصاویر (مانند Tiny-ImageNet).
✅ قابلیت کاربرد در مدلهای چندوجهی (تصویر-متن).
این نوآوری راه را برای آموزش مدلهای قدرتمند با دادههای بسیار کمتر باز میکند!
🔗 جزئیات بیشتر و کد پروژه در گیتهاب:
https://github.com/hrtan/infmatch
منبع: arXiv Computer Vision
