دانشمندان در پژوهشی جدید، چارچوب نوآورانهای به نام «Policy of Thoughts» یا به اختصار PoT معرفی کردهاند که به مدلهای زبانی اجازه میدهد هنگام حل مسائل پیچیده، استراتژی خود را در لحظه اصلاح کنند.
این روش با الهام از فرآیند «حدس و ابطال» پوپر، به مدل کمک میکند از اشتباهات خود در حین اجرای کد درس بگیرد و با بهروزرسانی لحظهای، به پاسخهای بسیار دقیقتری برسد. نتیجه شگفتانگیز این است که یک مدل کوچک ۴ میلیاردی با این روش توانسته در حل مسائل برنامهنویسی، مدلهای غولپیکری مثل GPT-4o و DeepSeek-V3 را پشت سر بگذارد! این یعنی آینده هوش مصنوعی نه فقط در اندازه مدل، بلکه در نحوه «تفکر و یادگیری» آنهاست.
منبع: arXiv AI
