محققان در دستاورد جدیدی مدل «SpatialThinker» را معرفی کردهاند که یکی از بزرگترین چالشهای مدلهای زبانی چندوجهی (MLLM)، یعنی «استدلال فضایی»، را هدف قرار داده است.
این مدل با ادغام تولید گراف صحنه (SGG) و یادگیری تقویتشده، به جای نگاه سطحی به تصاویر، یک نقشه ذهنی از اشیاء و روابط بین آنها میسازد. نتیجه؟ عملکردی که در تستهای استدلال فضایی، مدلهای غولآسایی مثل GPT-4o و حتی GPT-5 را پشت سر میگذارد! 🚀
نکته جذاب اینجاست که این مدل با وجود ابعاد کوچکش (۷ میلیارد پارامتر)، دقت خیرهکنندهای دارد و نشان میدهد هوش مصنوعی چقدر در درک دنیای سهبعدی اطراف ما در حال پیشرفت است.
منبع: arXiv AI
