بث الرموز
بث الرموز (Token streaming) هو طريقة لتوصيل المخرجات من نموذج اللغة الكبير (LLM) إلى المستخدم النهائي أو تطبيق العميل بشكل تدريجي، مع توليد كل رمز على حدة، بدلاً من الانتظار حتى يتم حساب الاستجابة بأكملها وإعادتها في كتلة واحدة.
بدلاً من التأخير الطويل أثناء معالجة النموذج للموجه (prompt) بأكمله، يرسل النظام أجزاء صغيرة من النص (رموز) على الفور. هذا يخلق إحساسًا بالاستجابة الفورية، حتى لو ظل إجمالي وقت التوليد كما هو.
بالنسبة لتطبيقات الذكاء الاصطناعي الحديثة، يعد زمن الاستجابة (latency) عاملاً حاسماً في رضا المستخدم. تتطلب استدعاءات واجهة برمجة التطبيقات (API) التقليدية، التي تتم على شكل دفعات (batch-style)، من المستخدمين التحديق في مؤشر التحميل حتى يظهر الكلمة الأخيرة. يغير بث الرموز نموذج التفاعل هذا بشكل جذري.
إنه يحسن بشكل كبير الأداء المتصور للتطبيق. يمكن للمستخدمين البدء في قراءة المحتوى والتفاعل معه على الفور تقريبًا، مما يؤدي إلى تجربة عملاء (CX) أفضل بكثير ومعدلات مشاركة أعلى.
عندما يستخدم تطبيق بث الرموز، فإنه ينشئ اتصالاً ثنائي الاتجاه ومستمرًا بنقطة نهاية نموذج اللغة الكبير (LLM endpoint)، وغالبًا ما يستخدم بروتوكولات مثل أحداث الخادم المرسلة (Server-Sent Events - SSE) أو مقابس الويب (WebSockets).
يعد بث الرموز أساسيًا للعديد من ميزات الذكاء الاصطناعي عالية القيمة:
إن مزايا تطبيق بث الرموز واضحة وقابلة للقياس:
على الرغم من فوائده، يضيف البث تعقيدًا:
يرتبط بث الرموز ارتباطًا وثيقًا بالبرمجة غير المتزامنة، وأنماط تصميم واجهة برمجة التطبيقات (مثل SSE)، والآليات الأساسية لنماذج المحولات (transformer models). إنه آلية توصيل مبنية على قدرة نموذج اللغة الكبير (LLM) على توليد الرموز.