آیا مدلهای هوش مصنوعی واقعاً مثل انسانها حرف میزنند یا فقط از قالبهای تکراری استفاده میکنند؟
محققان در مطالعه جدیدی به بررسی «ساختار اطلاعات» در خروجی مدلهای بینایی-زبانی (VLM) پرداختهاند. برخلاف انسانها که بسته به بافت متن، از ساختارهای متنوعی برای بیان موضوعات استفاده میکنند، مدلهای فعلی دچار نوعی «تکرار قالبی» (Mode Collapse) میشوند و انعطافپذیری لازم را در انتخاب ساختارهای دستوری ندارند. این تحقیق نشان میدهد که برای رسیدن به هوش مصنوعی واقعی، ارزیابی این مدلها باید فراتر از «دقت محتوا» رفته و به «نحوه بستهبندی اطلاعات» نیز توجه کند. 🔍
منبع: arXiv NLP
