محققان در مقالهای جدید، چارچوب نوآورانهای را معرفی کردهاند که دنیای دادههای بصری (عکس و ویدیو) و متن را به شیوهای متفاوت به هم پیوند میدهد. در این روش، هر ورودی بصری به مجموعهای از «گزارههای اتمی» (Atomic Propositions) تبدیل میشود؛ یعنی اطلاعات به جای پیکسل، به شکل جملات ساده و قابلفهم در مورد اشیاء، رفتارها و روابط موجود در صحنه بازنمایی میشوند.
این رویکرد به مدلهای هوش مصنوعی اجازه میدهد تا با استفاده از یک واژهنامه مشترک، تحلیلهای دقیقتر و قابلتفسیرتری از محیطهای پیچیده (مانند رانندگی خودران) ارائه دهند. این یعنی پیشرفت در استدلال هوشمند و بازیابی دقیق اطلاعات از دل دادههای حجیم! 🔍🌐
منبع: arXiv AI
