🔍 کشف مسیرهای مخفی در مغز مدل‌های چندوجهی (VLM)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا حالا فکر کردید وقتی یک مدل هوش مصنوعی به عکس نگاه می‌کند و درباره آن حرف می‌زند، اطلاعات تصویر چطور در لایه‌های مدل جابجا می‌شود؟

محققان در مطالعه جدیدی به سراغ کالبدشکافی مدل‌های بینایی-زبانی (VLM) رفته‌اند و متوجه شدند این مدل‌ها برای تحلیل تصاویر از دو مسیر هوشمندانه استفاده می‌کنند:

1️⃣ مسیر مستقیم: اطلاعات تصویری در توکن‌های عکس باقی می‌مانند و مستقیماً توسط مدل خوانده می‌شوند.
2️⃣ مسیر متنی: اطلاعات ابتدا به «توکن‌های پرسش» منتقل شده و سپس پردازش می‌شوند.

جالب اینجاست که مدل‌ها بسیار منعطف هستند؛ اگر یکی از این مسیرها دچار اختلال شود، مدل بلافاصله از مسیر دیگر به عنوان جایگزین استفاده می‌کند! این یافته‌ها به ما کمک می‌کند تا بهتر بفهمیم «جعبه سیاه» هوش مصنوعی واقعاً چطور فکر می‌کند.

منبع: arXiv Computer Vision