تخزين ذاكرة التخزين المؤقت للمطالبات
التخزين المؤقت للمطالبات (Prompt Caching) هو تقنية تُستخدم في التطبيقات التي تتفاعل مع نماذج اللغة الكبيرة (LLMs) أو خدمات الذكاء الاصطناعي التوليدي الأخرى. تتضمن هذه التقنية تخزين المطالبات المدخلة والمخرجات المقابلة لها (أو النتائج الوسيطة) في مخزن ذاكرة سريع ومتاح. عندما يتم إرسال نفس المطالبة أو مطالبة مشابهة جدًا مرة أخرى، يقوم النظام باسترداد الاستجابة المخزنة مؤقتًا بدلاً من إعادة تشغيل عملية الاستدلال المكلفة حسابيًا على نموذج اللغة الكبير.
في بيئات الإنتاج، يرسل العديد من المستخدمين استفسارات متكررة، خاصة أثناء الاختبار أو التطوير التكراري أو عند استخدام سير عمل موحد. بدون التخزين المؤقت، تجبر كل طلب متطابق نموذج اللغة الكبير على إجراء تمريرة أمامية كاملة عبر شبكته العصبية، مما يستهلك موارد حاسوبية كبيرة (وقت وحدة معالجة الرسوميات GPU) ويتكبد تكاليف مباشرة لواجهة برمجة التطبيقات (API). يعالج التخزين المؤقت للمطالبات هذه أوجه القصور بشكل مباشر.
عند وصول طلب، يتحقق النظام أولاً من الذاكرة المؤقتة باستخدام دالة تجزئة (hash) أو مقياس تشابه مشتق من المطالبة. إذا تم العثور على تطابق، يتم إرجاع النتيجة المخزنة على الفور. إذا لم يكن هناك تطابق، يتم إرسال المطالبة إلى نموذج اللغة الكبير للمعالجة. بمجرد أن يعيد نموذج اللغة الكبير الاستجابة، يقوم النظام بتخزين كل من المطالبة والمخرج المُولَّد في الذاكرة المؤقتة قبل إرجاع النتيجة للمستخدم. تعد استراتيجيات إبطال صلاحية الذاكرة المؤقتة (Cache Invalidation) أمرًا بالغ الأهمية لضمان عدم تقديم بيانات قديمة.
يعد التخزين المؤقت للمطالبات فعالاً للغاية في عدة سيناريوهات:
تتعدد مزايا تطبيق التخزين المؤقت للمطالبات:
على الرغم من قوته، يضيف التخزين المؤقت للمطالبات تعقيدًا:
تشمل المفاهيم ذات الصلة قواعد البيانات المتجهة (Vector Databases) (المستخدمة للبحث عن التشابه الدلالي في التخزين المؤقت)، وتكميم النموذج (Model Quantization) (وهي تقنية لتقليل حجم/تكلفة النموذج)، وإدارة الجلسات (Session Management) (لتتبع سياق المستخدم عبر مطالبات متعددة).