محققان در یک دستاورد تازه، موفق شدند یک مدل «متن به گفتار» (TTS) پیشرفته را برای زبان هندی بهینهسازی کنند. نکته جالب اینجاست که آنها با استفاده از روش «هرس کردن عمقی» (Depth-Pruning)، یک مدل سنگین ۳۳۷ میلیون پارامتری را به مدلی سبک و سریع تبدیل کردند که حالا میتواند روی کارت گرافیکهای معمولی لپتاپ (۶ گیگابایت VRAM) به صورت بلادرنگ (Real-time) اجرا شود.
این روش نه تنها کیفیت صدای بسیار بالایی ارائه میدهد، بلکه راهکاری عملی برای اجرا کردن مدلهای سنگین هوش مصنوعی روی سختافزارهای محدودتر است. پیشرفت در مدلهای زبانی محلی (Low-resource languages) گام بزرگی برای دسترسی همگانی به فناوریهای هوشمند محسوب میشود. 🔥
منبع: arXiv NLP
