تحقیقات جدید در یک مقاله علمی معتبر نشان میدهد که فیلترهای امنیتی فعلی در مدلهای زبانی بزرگ (LLM) شاید آنقدر که فکر میکنیم قدرتمند نباشند! 🧐
بر اساس این مطالعه، ترکیب روشهای «تراز کردن» مدل (Alignment) و «فیلترهای محدود» (Bounded Filtering) لزوماً نمیتواند احتمال تولید محتوای مضر را به صفر برساند. محققان با بررسی مدلهای متنباز و تجاری، به این نتیجه رسیدهاند که حتی با بهترین فیلترها، همچنان احتمال عبور خروجیهای نامطلوب از سد دفاعی مدلها وجود دارد. این یعنی برای رسیدن به یک هوش مصنوعی کاملاً امن، هنوز راه درازی در پیش داریم و چالشهای فنی مهمی پیش روی مهندسان قرار دارد. 🤖⚠️
نظر شما چیست؟ آیا هوش مصنوعی در نهایت میتواند ۱۰۰٪ امن شود یا باید همیشه مراقب خروجیهای آن باشیم؟
منبع: arXiv Machine Learning
