تا حالا فکر کردید وقتی یک مدل هوش مصنوعی به عکس نگاه میکند و درباره آن حرف میزند، اطلاعات تصویر چطور در لایههای مدل جابجا میشود؟
محققان در مطالعه جدیدی به سراغ کالبدشکافی مدلهای بینایی-زبانی (VLM) رفتهاند و متوجه شدند این مدلها برای تحلیل تصاویر از دو مسیر هوشمندانه استفاده میکنند:
1️⃣ مسیر مستقیم: اطلاعات تصویری در توکنهای عکس باقی میمانند و مستقیماً توسط مدل خوانده میشوند.
2️⃣ مسیر متنی: اطلاعات ابتدا به «توکنهای پرسش» منتقل شده و سپس پردازش میشوند.
جالب اینجاست که مدلها بسیار منعطف هستند؛ اگر یکی از این مسیرها دچار اختلال شود، مدل بلافاصله از مسیر دیگر به عنوان جایگزین استفاده میکند! این یافتهها به ما کمک میکند تا بهتر بفهمیم «جعبه سیاه» هوش مصنوعی واقعاً چطور فکر میکند.
منبع: arXiv Computer Vision
