تا حالا به این فکر کردید که چرا برای پردازش هر تصویر در مدلهای چندوجهی باید هزینه سنگینی بابت استفاده از مدلهای ویژن (VLM) پرداخت کنیم؟ 🖼️💸
محققان در مقاله جدیدی راهکار جذابی به نام «تشدید مودالیته انتخابی پسرویدادی» (Post-hoc Selective Modality Escalation) ارائه دادهاند. نکته کلیدی اینجاست: نیازی نیست از همان ابتدا برای همه چیز از هوش مصنوعی ویژنی استفاده کنید!
این سیستم جدید ابتدا با استفاده از متن و جدولها (که ارزانتر هستند) پاسخ اولیه را میسازد و سپس فقط در صورتی که واقعاً نیاز باشد، به سراغ تحلیل تصویر میرود. نتیجه؟ دقتِ بالا در کنار کاهش چشمگیر هزینههای پردازشی. این یعنی هوش مصنوعی هوشمندتر و اقتصادیتر برای کاربردهای واقعی! 🧠📉
منبع: arXiv AI
