محققان در مقاله جدیدی راهکار هوشمندانهای به نام FusionML معرفی کردند که با استفاده همزمان از قدرت CPU و GPU در تراشههای اپل (Apple Silicon)، سرعت اجرای مدلهای هوش مصنوعی (مانند Llama و Qwen) را تا ۳۸ درصد در مرحله «پیشپردازش» (Prefill) افزایش میدهد.
نکته کلیدی این تحقیق، رفع محدودیتهای زمانبندی گرافهای تنبل در فریمورک MLX است که اجازه میدهد پردازشها بهصورت موازی و بسیار بهینهتر انجام شوند. این خبر برای توسعهدهندگانی که از مکبوکهای قدرتمند برای اجرای لوکال مدلهای زبانی استفاده میکنند، یک ارتقای نرمافزاری فوقالعاده محسوب میشود! 🔥
منبع: arXiv Machine Learning
