🚀 تحولی در یادگیری تقویتی؛ کاوش مبتنی بر پرامپت (PDE)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان روش جدیدی به نام «Prompt-Driven Exploration» معرفی کرده‌اند که یادگیری تقویتی (RL) را متحول می‌کند! 🧠

تا پیش از این، روش‌های سنتی برای یادگیری، نویزهای تصادفی به رفتار مدل اضافه می‌کردند که اغلب ناکارآمد بود. اما در این متد جدید، از مدل‌های زبانی-تصویری (VLM) استفاده می‌شود تا با بررسی ویدیوهای خروجی، پرامپت‌ها را بازنویسی و بهینه‌سازی کنند.

مزیت اصلی: این روش به هوش مصنوعی اجازه می‌دهد حتی از نقاط شروع با «پاداش صفر» (Zero-reward) یاد بگیرد و فرآیند یادگیری را بسیار سریع‌تر و هوشمندتر کند.

اگر در زمینه RL و مدل‌های زبانی فعالیت دارید، بررسی این پژوهش جدید بسیار جذاب خواهد بود.

🔗 اطلاعات بیشتر در سایت پروژه

منبع: arXiv AI