محققان در مقاله جدیدی روش هوشمندانهای برای بهبود طبقهبندی تصاویر ارائه دادند. در این روش، به جای اتکای صرف به کدهای تصویری، از قدرت «مدلهای زبانی بزرگ» (LLMs) برای تحلیل دقیقتر ارتباط معنایی بین تصاویر استفاده شده است.
با کمک مدلهای بینایی-زبانی (VLM)، تصاویر به توصیفات متنی تبدیل شده و سپس LLM با تحلیل این متنها، نویزهای گرافهای سنتی (مثل kNN) را حذف میکند. نتیجه؟ دقت بسیار بالاتر در طبقهبندی تصاویر که یک گام مهم برای کاهش هزینههای برچسبگذاری دادههاست. 🚀✨
منبع: arXiv AI
