بسیاری از دادههای دنیای کسبوکار در قالب جداول (Tables) ذخیره شدهاند، اما مدلهای زبانی (LLM) هنوز در استدلالهای پیچیده روی این دادههای ساختاریافته چالش دارند.
بهتازگی بنچمارک جدیدی به نام TReB معرفی شده که به طور تخصصی روی توانایی هوش مصنوعی در درک و تحلیل جداول تمرکز دارد. این بنچمارک شامل ۲۶ زیرشاخه مختلف است تا هم تواناییهای ساده و هم استدلالهای عمیق مدلها را به چالش بکشد.
نتایج این تحقیق نشان میدهد که هنوز راه زیادی برای بهبود مدلهای فعلی در درک دادههای جدولی باقی مانده است. اگر توسعهدهنده هستید یا با دادههای حجیم سر و کار دارید، بررسی این بنچمارک میتواند دید خوبی به شما بدهد.
🔗 لینک دیتاست در Hugging Face: https://huggingface.co/datasets/JT-LM/JIUTIAN-TReB
منبع: arXiv AI
