تخمین حجم و مقدار کالری غذاها از روی عکس، همیشه پاشنه آشیل مدلهای چندوجهی (MLLM) بوده و حتی مدلهای قدرتمندی مثل Gemini یا GPT هم در این زمینه ضعیف عمل میکردند.
اما محققان در یک پژوهش جدید، راهکار هوشمندانهای پیدا کردهاند! آنها با اضافه کردن یک «شبکه هندسی» به مدلهای فعلی، توانستهاند خطای تخمین مقدار غذا را ۳۳ تا ۴۱ درصد کاهش دهند. جالب اینجاست که برای این کار نیازی به سنسورهای عمقسنج یا آموزش مجدد مدلهای سنگین نیست!
این یعنی در آیندهای نزدیک، اپلیکیشنهای سلامتی میتوانند خیلی دقیقتر از قبل، فقط با یک عکس، رژیم غذایی شما را تحلیل کنند. 📊✨
منبع: arXiv AI
