🤖 جهش بزرگ در تولید ویدیوهای تعاملی با AgentHOI

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تولید ویدیوهایی که در آن‌ها انسان با اشیاء به درستی تعامل دارد (مثل پوشیدن لباس یا دوچرخه‌سواری)، همیشه برای هوش مصنوعی چالش‌برانگیز بوده است. حالا محققان با معرفی مدل «AgentHOI» این معادله را تغییر داده‌اند!

💡 این مدل جدید با استفاده از «استدلال چندعامله» (Multi-Agent Reasoning) و یک چارچوب «فکر کردن قبل از تولید»، شکاف بین دستورات متنی و اجرای فیزیکی را پر می‌کند. برخلاف روش‌های قدیمی که نیاز به کنترل‌های حرکتی پیچیده داشتند، AgentHOI می‌تواند تنها با دریافت یک متن، ویدیوهایی بسیار طبیعی و دقیق تولید کند.

این یعنی در آینده نزدیک شاهد ویدیوهایی خواهیم بود که در آن‌ها تعامل انسان با محیط بسیار واقعی‌تر و هوشمندتر به نظر می‌رسد.

🔗 کد پروژه هم در گیت‌هاب در دسترس قرار گرفته است.

منبع: arXiv Computer Vision