🧠 چالش جدید در درک زبان توسط مدل‌های بینایی-زبانی (VLM)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا مدل‌های هوش مصنوعی واقعاً مثل انسان‌ها حرف می‌زنند یا فقط از قالب‌های تکراری استفاده می‌کنند؟

محققان در مطالعه جدیدی به بررسی «ساختار اطلاعات» در خروجی مدل‌های بینایی-زبانی (VLM) پرداخته‌اند. برخلاف انسان‌ها که بسته به بافت متن، از ساختارهای متنوعی برای بیان موضوعات استفاده می‌کنند، مدل‌های فعلی دچار نوعی «تکرار قالبی» (Mode Collapse) می‌شوند و انعطاف‌پذیری لازم را در انتخاب ساختارهای دستوری ندارند. این تحقیق نشان می‌دهد که برای رسیدن به هوش مصنوعی واقعی، ارزیابی این مدل‌ها باید فراتر از «دقت محتوا» رفته و به «نحوه بسته‌بندی اطلاعات» نیز توجه کند. 🔍

منبع: arXiv NLP