محققان روش جدیدی به نام «Prompt-Driven Exploration» معرفی کردهاند که یادگیری تقویتی (RL) را متحول میکند! 🧠
تا پیش از این، روشهای سنتی برای یادگیری، نویزهای تصادفی به رفتار مدل اضافه میکردند که اغلب ناکارآمد بود. اما در این متد جدید، از مدلهای زبانی-تصویری (VLM) استفاده میشود تا با بررسی ویدیوهای خروجی، پرامپتها را بازنویسی و بهینهسازی کنند.
✅ مزیت اصلی: این روش به هوش مصنوعی اجازه میدهد حتی از نقاط شروع با «پاداش صفر» (Zero-reward) یاد بگیرد و فرآیند یادگیری را بسیار سریعتر و هوشمندتر کند.
اگر در زمینه RL و مدلهای زبانی فعالیت دارید، بررسی این پژوهش جدید بسیار جذاب خواهد بود.
منبع: arXiv AI
