تا به حال به این فکر کردید که چرا عاملهای هوش مصنوعی (AI Agents) گاهی اشتباهات گذشته تیمهای مهندسی را تکرار میکنند؟
ابزار جدید و متنباز VetoBench با رویکردی متفاوت، بهجای تستِ صرفِ دقتِ بازیابی اطلاعات، به سراغ «کیفیت تصمیمگیری» رفته است. این بنچمارک بررسی میکند که آیا یک عامل هوشمند:
✅ راهکارهای قبلاً رد شده (Vetoed) را دوباره پیشنهاد میدهد؟
✅ تشخیص میدهد که یک حافظه یا تجربه خاص دیگر اعتبار ندارد؟
این یک قدم رو به جلو برای ساخت ایجنتهای هوشمندتر و آگاهتر از محدودیتهای فنی است. نظر شما چیست؟ آیا هوش مصنوعی میتواند به بلوغِ «درس گرفتن از اشتباهات» برسد؟
منبع: Hacker News AI
