تا به حال فکر کردید که چطور یک مدل هوش مصنوعی میتواند بدون آموزش مجدد، از یک وظیفه بصری (مثل ویرایش تصویر) برای انجام وظیفهای متفاوت الهام بگیرد؟ محققان بهتازگی چارچوب «T2T-VICL» را معرفی کردهاند که این چالش را حل میکند.
این مدل با تبدیل تفاوتهای بین وظایف به «راهنماییهای متنی»، به مدلهای بصری کمک میکند تا حتی وقتی مثالهای آموزشی با هدف نهایی تفاوت دارند، باز هم نتایج درخشانی ارائه دهند. این یعنی یک گام بزرگ دیگر به سمت مدلهای بصری انعطافپذیرتر و هوشمندتر! 🧠✨
منبع: arXiv AI
