محققان به تازگی چارچوب هوشمندی به نام CHAT را معرفی کردهاند که میتواند مکالمات دو نفره (صوتی و تصویری) را تنها با یک متن ساده تولید کند.
این فناوری که بر پایه مدلهای زبانی بزرگ (LLM) و مدلهای چهرهسخنگو (Talking Face) بنا شده، میتواند بدون نیاز به جمعآوری دادههای هزینهبر و حساس، آواتارهای دیجیتال و انسانهای مجازی فوقالعاده واقعی با واکنشهای طبیعی بسازد. خروجی این مدل، دیالوگهایی هماهنگ با حرکات لب و چهره است که میتواند انقلابی در ساخت دستیارهای مجازی هوشمند ایجاد کند. 🤖✨
منبع: arXiv Computer Vision
