محققان مدل جدیدی به نام LlamaSeg معرفی کردهاند که دنیای «بخشبندی تصویر» (Image Segmentation) را با قدرت مدلهای زبانی دگرگون میکند.
این مدل با رویکردی خلاقانه، ماسکهای تصویری را به توکنهای بصری تبدیل کرده و از معماری خانواده Llama برای تحلیل و تولید دقیق آنها استفاده میکند.
چرا این خبر مهم است؟
✅ پشتیبانی از دستورات متنی (Natural Language Instructions) برای شناسایی اشیاء در تصویر.
✅ عرضه مجموعه داده عظیم SA-OVRS با بیش از ۲ میلیون ماسک دقیق.
✅ دقت بسیار بالاتر در مرزبندیهای ظریف نسبت به مدلهای مشابه قبلی.
این پیشرفت نشان میدهد که ترکیب قدرت مدلهای زبانی با بینایی ماشین، هر روز مرزهای جدیدی را برای هوش مصنوعی باز میکند.
🔗 لینک کد و دادهها برای علاقهمندان در گیتهاب موجود است.
منبع: arXiv Computer Vision
