ترجمه همزمان گفتار (SimulST) یکی از چالشبرانگیزترین حوزهها در هوش مصنوعی است، بهویژه وقتی بخواهیم مدلهای زبانی بزرگ (LLM) را بدون تغییرات پیچیده در معماری، برای این کار بهینه کنیم.
محققان در مقاله جدید خود به سراغ راهکاری متفاوت رفتهاند: استفاده از «روش دادهمحور» به جای تغییرات ساختاری. آنها با معرفی متد CSSEL-P2P توانستهاند با استفاده از یادگیریِ پیشوند (Prefix-to-Prefix)، کیفیت ترجمه را در محیطهای مکالمهای بهطور چشمگیری بهبود ببخشند، بدون اینکه مدل را با تأخیرهای سنگین یا معماریهای پیچیده درگیر کنند.
این پیشرفت نشان میدهد که با استراتژیهای هوشمندانه در پردازش دادهها، میتوان کارایی مدلهای زبانی را در پردازش زنده صدا به شدت ارتقا داد. 🎤🌐
منبع: arXiv NLP
