💡 توسعه توکنایزرها در مدل‌های هوش مصنوعی؛ هوشمندتر از همیشه!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان در مقاله جدیدی، روشی نوآورانه برای «توسعه توکنایزر» (Tokenizer Expansion) معرفی کرده‌اند که به مدل‌های زبانی بزرگ (LLM) اجازه می‌دهد بدون نیاز به آموزش از صفر، دایره لغات خود را گسترش دهند.

این تکنیک به‌ویژه برای مدل‌های روی دستگاه (On-device) بسیار حیاتی است؛ چرا که با بهینه‌سازی توکن‌بندی، سرعت مدل را بالا برده و مصرف انرژی و حافظه را برای زبان‌های جدید کاهش می‌دهد. با این متد، مدل‌های کوچک‌تر هم می‌توانند به کارایی مدل‌های ابری بزرگ دست پیدا کنند. 🚀

منبع: arXiv Machine Learning