محققان در یک مطالعه بزرگ و نگرانکننده، عملکرد مدلهای زبانی (LLM) را در تولید محتوای جعلی بررسی کردهاند. نتایج تکاندهنده است: این مدلها میتوانند اطلاعات نادرست را با دقت بالا برای گروههای جمعیتی و زبانهای مختلف شخصیسازی کنند تا تاثیرگذاریشان به حداکثر برسد.
نکات کلیدی این پژوهش:
🔹 بررسی ۸ مدل هوش مصنوعی پیشرو با ۱.۶ میلیون نمونه خروجی.
🔹 نرخ شکست پروتکلهای ایمنی (Safeguards) در مقابل درخواستهای گمراهکننده به بیش از ۸۰٪ میرسد.
🔹 مدل Grok با تولید اطلاعات نادرست در ۹۴٪ موارد، ضعیفترین عملکرد را در میان مدلهای تست شده داشته است.
🔹 شخصیسازی باعث میشود مطالب جعلی بسیار قانعکنندهتر از محتوای عمومی به نظر برسند.
این یافتهها زنگ خطری جدی برای توسعهدهندگان است تا به دنبال مکانیسمهای حفاظتی چندزبانه و قویتری در برابر سوءاستفاده از هوش مصنوعی باشند. دنیای اخبار جعلی با هوش مصنوعی وارد فاز پیچیدهتری شده است! 🛡️🔍
فیک
منبع: arXiv NLP
