مزيج الخبراء
مزيج الخبراء (MoE) هو بنية تعلم آلي يتكون فيها النموذج من عدة شبكات فرعية مستقلة، تُعرف باسم "الخبراء". فبدلاً من أن يقوم نموذج واحد متراص بمعالجة جميع المدخلات، يقوم نموذج MoE بتوجيه كل مدخل إلى مجموعة فرعية محددة من هؤلاء الخبراء للمعالجة. تتم إدارة هذا التوجيه بواسطة "شبكة بوابة" أو "موجه".
غالباً ما تعاني الشبكات العصبية الكبيرة التقليدية من اختناقات حسابية أثناء الاستدلال والتدريب، مما يتطلب موارد هائلة للتوسع. يعالج نموذج MoE هذا الأمر عن طريق إدخال التناثر (Sparsity). فهو يسمح للنماذج بتحقيق أداء شبكة أكبر بكثير مع تفعيل جزء صغير فقط من إجمالي المعلمات لأي مدخل معين، مما يؤدي إلى مكاسب كبيرة في الكفاءة.
تتضمن العملية ثلاثة مكونات رئيسية:
تنتشر بنيات MoE بشكل متزايد في تطوير نماذج اللغة الكبيرة (LLMs) المتطورة. كما يجري استكشافها في أنظمة التوصية المعقدة، حيث قد يتخصص خبراء مختلفون في شرائح مستخدمين أو فئات منتجات مختلفة، وفي أنظمة ترتيب البحث واسعة النطاق.
الشبكات العصبية المتناثرة، الحوسبة الشرطية، دوال التنشيط المتناثرة، قوانين التوسع في الذكاء الاصطناعي