مدلهای بزرگ زبانی (LLM) معمولاً بر اساس دادههای انگلیسی و غربی آموزش دیدهاند که باعث میشود در درک فرهنگها و زبانهای بومی با چالش مواجه شوند. حالا محققان چارچوب جدیدی به نام «Inspect India Evals» را معرفی کردهاند که به طور خاص برای سنجش دقت، انصاف و ایمنی مدلها در بستر زبانها و سنتهای هندی طراحی شده است.
این ابزار اوپنسورس شامل بنچمارکهایی برای ۱۶ زبان مختلف، بررسی سوگیریهای اجتماعی و تستهای مقاومت در برابر جیلبریک است. در تستهای اولیه، مدلهای Sarvam-M و Gemma 2 عملکرد درخشانی در درک مفاهیم فرهنگی و ایمنی زیرساختهای دیجیتال از خود نشان دادند.
این حرکت، گامی مهم به سوی «هوش مصنوعی محلیسازی شده» است تا مدلها بتوانند در کشورهای غیر انگلیسیزبان نیز با دقت و امنیت بیشتری فعالیت کنند. 🚀
منبع: arXiv NLP
