یکی از چالشهای بزرگ مدلهای زبانی (LLMs) در سیستمهای RAG، ناتوانی در تشخیص بین اطلاعات مفید و دادههای گمراهکننده است. حالا محققان با معرفی بنچمارک جدید «SelectBench» و روش آموزش DAPO، به مدلها یاد میدهند که چطور مثل یک متخصص، شواهد درست را از اطلاعات مخرب یا جعلی جدا کنند.
این تحقیق نشان میدهد که چگونه میتوان مدلهایی مثل Qwen3.5 را آموزش داد تا نه تنها در برابر فریب مقاومتر باشند، بلکه پاسخهای دقیقتر و کوتاهتری ارائه دهند. قدمی مهم برای استفاده ایمنتر از هوش مصنوعی در دنیای واقعی! 🚀
منبع: arXiv NLP
