تولید ویدیوهایی که در آنها انسان با اشیاء به درستی تعامل دارد (مثل پوشیدن لباس یا دوچرخهسواری)، همیشه برای هوش مصنوعی چالشبرانگیز بوده است. حالا محققان با معرفی مدل «AgentHOI» این معادله را تغییر دادهاند!
💡 این مدل جدید با استفاده از «استدلال چندعامله» (Multi-Agent Reasoning) و یک چارچوب «فکر کردن قبل از تولید»، شکاف بین دستورات متنی و اجرای فیزیکی را پر میکند. برخلاف روشهای قدیمی که نیاز به کنترلهای حرکتی پیچیده داشتند، AgentHOI میتواند تنها با دریافت یک متن، ویدیوهایی بسیار طبیعی و دقیق تولید کند.
این یعنی در آینده نزدیک شاهد ویدیوهایی خواهیم بود که در آنها تعامل انسان با محیط بسیار واقعیتر و هوشمندتر به نظر میرسد.
🔗 کد پروژه هم در گیتهاب در دسترس قرار گرفته است.
منبع: arXiv Computer Vision
