محققان ابزار جدیدی به نام «Reforge» معرفی کردند که نحوه ارزیابی مدلهای زبانی (LLM) در حوزه مهندسی معکوس و تحلیل باینری را متحول میکند.
نکته کلیدی اینجاست: بسیاری از بنچمارکهای فعلی در درک کدهای بهینهشده توسط کامپایلر دچار خطا هستند و عملکرد مدلها را بیش از حد واقعی نشان میدهند. ابزار Reforge با استفاده از یک متدولوژی دقیق، سطح اطمینان ارزیابی را بالا برده و به توسعهدهندگان کمک میکند تا درک واقعیتری از توانمندی هوش مصنوعی در نامگذاری توابع و تحلیل کد داشته باشند. این گام بزرگی برای حرفهایتر شدن بنچمارکهای امنیتی است! 🛡️💻
نویسی
منبع: arXiv AI
