در یک پروژه جالب و فنی، یک مدل زبانی (LLM) با ۳۰ میلیون پارامتر از صفر آموزش داده شده است. برخلاف تصورات رایج که فکر میکردند برای رسیدن به عملکرد بهینه در مقیاس کوچک با یک «دیوار» یا محدودیت (Scaling Floor) مواجه هستیم، این تجربه نشان داد که چنین محدودیتی بیشتر یک توهم بوده است!
این تحقیق نشان میدهد که حتی با مدلهای کوچک نیز میتوان نتایج قابل توجهی گرفت و مسیر برای توسعهدهندگان مستقل که به سختافزارهای عظیم دسترسی ندارند، روشنتر است.
اگر به جزئیات فنی آموزش مدلهای کوچک علاقه دارید، این پروژه دید خوبی به شما میدهد.
منبع: Hacker News LLM
