🔍 چالش هندسه در مدل‌های بینایی-زبانی: آیا واقعاً از فضای هایپربولیک استفاده می‌شود؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

بسیاری تصور می‌کنند استفاده از مدل‌های هایپربولیک در سیستم‌های هوش مصنوعی باعث درک بهتر سلسله‌مراتب داده‌ها می‌شود، اما تحقیق جدیدی که به تازگی در arXiv منتشر شده، این ادعا را به چالش کشیده است! 📐

محققان با بررسی سه مدل پیشرو (MERU, HyCoCLIP, PHyCLIP) نشان دادند که:

۱. برخلاف تصور، این مدل‌ها در عمل از خواص هندسی هایپربولیک بهره چندانی نمی‌برند و رفتار آن‌ها بسیار نزدیک به فضای اقلیدسی (Euclidean) ساده است.
۲. مکانیسم‌های «مخروطی» (Cone machinery) که قرار بود سلسله‌مراتب را درک کنند، در مدل‌های فعلی عملاً غیرفعال یا ناقص هستند.
۳. موفقیت این مدل‌ها نه به خاطر هندسه پیچیده، بلکه به دلیل روش‌های نظارتی و داده‌های آموزشی دقیق‌تر است.

این یافته‌ها زنگ خطری است برای پژوهشگرانی که به دنبال بهینه‌سازی مدل‌ها با استفاده از هندسه غیر‌اقلیدسی هستند؛ شاید راه حل، مسیر دیگری باشد! 🤖💡

منبع: arXiv Computer Vision