محققان به تازگی مجموعهداده عظیم «GLAN-QnA-KR» را منتشر کردهاند که شامل بیش از ۳۰۳ هزار جفت پرسش و پاسخ برای آموزش مدلهای زبانی به زبان کرهای است. این پروژه که با استفاده از مدل Phi-3.5-MoE مایکروسافت تولید شده، یکی از بزرگترین و دقیقترین مجموعهدادههای مصنوعی است که تا به حال عرضه شده.
✅ ویژگیهای کلیدی این دیتاست:
• تنوع فوقالعاده با بیش از هزار موضوع تخصصی.
• دقت بسیار بالا و حذف تکراریها (تقریباً صفر درصد تکرار).
• عدم نشت اطلاعات از تستهای استاندارد، که آن را به ابزاری بسیار معتبر برای آموزش مدلها تبدیل میکند.
این اتفاق قدم بزرگی برای توسعه مدلهای هوش مصنوعی غیرانگلیسیزبان و افزایش کیفیت آنها محسوب میشود. 🇰🇷✨
منبع: arXiv Machine Learning
