اگر در حوزه یادگیری ماشین با دادههای جدولی (Tabular Data) سر و کار دارید، حتماً با چالشهای انتخاب دادههای آموزشی برای مدلهای «یادگیری در متن» (In-context Learning) مثل TabPFN آشنا هستید.
مطالعه جدیدی که به تازگی در arXiv منتشر شده، به بررسی دقیق نحوه انتخاب نمونههای آموزشی پرداخته و نتایج جالبی داشته است:
✅ اهمیت اندازه: افزایش تعداد نمونهها در context، نه تنها دقت را بالا میبرد، بلکه نوسانات پیشبینی را به شدت کاهش میدهد.
✅ تنوع مهمتر از تطابق: برخلاف تصور، صرفاً تلاش برای شبیهسازی میانگین ویژگیها کافی نیست؛ در واقع «تنوع و پوشش دهی دادهها» در فضای ویژگیها، فاکتورهای کلیدی برای رسیدن به دقت بالاتر هستند.
این یافتهها به توسعهدهندگان کمک میکند تا با انتخاب استراتژیکتر دادههای نمونه، عملکرد مدلهای خود را در پروژههای تحلیل داده به شکل چشمگیری بهبود ببخشند.
منبع: arXiv AI
