محققان در مقاله جدیدی از فریمورک نوآورانه «ARBITER» رونمایی کردند که برای افزایش امنیت مدلهای زبانی (LLM) طراحی شده است. این سیستم با استفاده از «استدلال دوگانه»، قبل از صدور هر خروجی، هم جنبههای ایمن و هم جنبههای ناایمنِ یک پرامپت را بررسی میکند تا تصمیم نهایی دقیقتر و قابلاعتمادتر باشد.
نکته جالب اینجاست که ARBITER برخلاف روشهای سنگین قبلی، بسیار بهینه است و با هزینه محاسباتی کم، عملکردی فراتر از مدلهای مشابه ارائه میدهد. این دستاورد گامی مهم برای افزایش شفافیت و ایمنی تعامل با هوش مصنوعی است. 🤖✨
منبع: arXiv AI
