محققان در مطالعهای جدید، چالش پیچیده درک ساختار سلسلهمراتبی و لایهبندی متنها در تصاویر روزنامهها را هدف قرار دادهاند. این پژوهش دو رویکرد جذاب ارائه میدهد:
۱. یک مدل ترکیبی (Bottom-up) با استفاده از YOLO و LayoutReader برای شناسایی دقیق بخشهای مختلف صفحه.
۲. معرفی «Tiramisu»؛ یک معماری جدید مبتنی بر ترنسفورمر که به طور اختصاصی برای مدلسازی ساختار سلسلهمراتبی اسناد طراحی شده است.
این پیشرفت نه تنها به دیجیتالیسازی دقیقتر آرشیوهای تاریخی کمک میکند، بلکه راه را برای درک بهتر ساختارهای پیچیده متنی در هوش مصنوعی هموار میسازد.
منبع: arXiv Computer Vision
