حتماً متوجه شدید که مدلهای تبدیل متن به تصویر (Text-to-Image) با وجود خروجیهای جذاب، گاهی قوانین ساده فیزیکی (مثل افتادن اشیا یا سایهها) را کاملاً نادیده میگیرند. محققان به تازگی بنچمارک جدیدی به نام OmniPhys معرفی کردهاند که دقیقاً برای سنجش درک فیزیکی این مدلها طراحی شده است.
ویژگیهای کلیدی این پژوهش:
🔹 معرفی OmniPhys: استفاده از گراف دانش فیزیکی برای به چالش کشیدن مدلها.
🔹 سیستم OmniPrompt: یک روش بهینهسازی جدید که با استفاده از بازخورد تکرارشونده، خطاهای فیزیکی مدلها را به حداقل میرساند.
🔹 نتایج نشان میدهد که حتی قدرتمندترین مدلهای فعلی هم در «فیزیکِ تصویر» دچار ضعف هستند، اما با این متد جدید، دقت آنها بهطور چشمگیری افزایش مییابد.
به نظر شما، چه زمانی هوش مصنوعی میتواند درک کاملی از دنیای فیزیکی اطراف ما پیدا کند؟ نظر بدهید! 👇
منبع: arXiv AI
