Wakeb Data مهندس أول للذكاء الاصطناعي وMLOps 2024–2026

روبوت محادثة ثنائي اللغة من 6 وكلاء على Qwen ذاتي الاستضافة

تصميم روبوت محادثة غير متزامن من 6 وكلاء على LangGraph بالعربية والإنجليزية، وتشغيل نماذج Qwen عبر vLLM على خوادم A100 في بيئة الإنتاج.

اطّلع على البنية
الدور
التصميم المعماري والبناء وخدمة النماذج (مهندس أول للذكاء الاصطناعي وMLOps) دوام كامل، هجين
الجهة
Wakeb Data روبوت محادثة في بيئة الإنتاج
الفترة
خلال العمل في Wakeb Data سبتمبر 2024 – أبريل 2026
المكان
الجيزة، مصر
التقنيات
  • LangGraph
  • Qwen
  • vLLM
  • NVIDIA A100
  • FastAPI
  • Docker
  • Nginx
وكلاء متخصصين على LangGraph، غير متزامن بالكامل
6
خوادم GPU تشغّل Qwen عبر vLLM
A100
في روبوت محادثة واحد ثنائي اللغة
AR + EN
Fig. 1 wakeb-multi-agent-chatbot · architecture
روبوت محادثة متعدد الوكلاء: LangGraph غير متزامن بالكامل بستة وكلاء متخصصينمخطط معماري. يكتب المستخدم بالعربية أو الإنجليزية. تمر الطلبات عبر Nginx، وهو وكيل عكسي، إلى خدمات FastAPI داخل حاويات Docker، وتستخدم الواجهات الداخلية الأساسية gRPC. داخل رسم LangGraph غير متزامن بالكامل، ينقل التوجيه القائم على Command، دون حواف ثابتة، التحكم بين ستة وكلاء متخصصين مبنيين كرسوم فرعية قابلة للتركيب. ويستدعي الرسم أربع خدمات خلفية: نموذج Qwen الذي يخدّمه vLLM على معالجات A100، واسترجاعًا هجينًا يجمع بحث المتجهات وBM25 مع إعادة ترتيب بواسطة LLM، وBrave Search عبر MCP، وذاكرة تخزين مؤقت على مستوى العُقد مبنية على SQLite.LANGGRAPH · FULLY ASYNC6 AGENTSUserArabic · EnglishNginxreverse proxyFastAPI servicesDocker · gRPC1Command routingno static edges2Qwen LLMvLLM · A100 GPUs4Hybrid retrievalvector + BM25 · LLM rerank5Brave Searchvia MCP6Node cacheSQLite73orchestratoragentretrieval · datamodel · LLMservice · infrastoreexternalrequest1note
روبوت محادثة متعدد الوكلاء: LangGraph غير متزامن بالكامل بستة وكلاء متخصصينمخطط معماري. يكتب المستخدم بالعربية أو الإنجليزية. تمر الطلبات عبر Nginx، وهو وكيل عكسي، إلى خدمات FastAPI داخل حاويات Docker، وتستخدم الواجهات الداخلية الأساسية gRPC. داخل رسم LangGraph غير متزامن بالكامل، ينقل التوجيه القائم على Command، دون حواف ثابتة، التحكم بين ستة وكلاء متخصصين مبنيين كرسوم فرعية قابلة للتركيب. ويستدعي الرسم أربع خدمات خلفية: نموذج Qwen الذي يخدّمه vLLM على معالجات A100، واسترجاعًا هجينًا يجمع بحث المتجهات وBM25 مع إعادة ترتيب بواسطة LLM، وBrave Search عبر MCP، وذاكرة تخزين مؤقت على مستوى العُقد مبنية على SQLite.LANGGRAPH · ASYNC6 AGENTSUserArabic · EnglishNginxreverse proxyFastAPI servicesDocker · gRPC1Command routingno static edges2Qwen LLMvLLM · A100 GPUs4Hybrid retrievalvector + BM25 · LLM rerank5Brave Searchvia MCP6Node cacheSQLite73orchestratoragentretrieval · datamodel · LLMservice · infrastoreexternalrequest1note

الشكل 1 روبوت محادثة ثنائي اللغة متعدد الوكلاء وغير متزامن بالكامل: ينقل LangGraph التحكم بين ستة وكلاء متخصصين بتوجيه قائم على Command دون حواف ثابتة، فوق نموذج Qwen الذي يخدّمه vLLM على معالجات A100، مع استرجاع هجين وبحث في الويب عبر MCP وتخزين مؤقت على مستوى العُقد. تعرض المخططات المكوّنات المذكورة في الأوصاف المنشورة للعمل، وهي مبسّطة وليست خرائط كاملة للأنظمة.

  1. الخدمات. خدمات FastAPI داخل حاويات Docker خلف Nginx، مع نقل واجهات داخلية أساسية من REST إلى gRPC لتقليل زمن الاستجابة بين الخدمات.
  2. التوجيه. قائم على Command ودون حواف ثابتة: ينتقل التحكم بين الوكلاء عبر Command في LangGraph بدلًا من حواف ثابتة في الرسم البياني.
  3. الوكلاء. ستة وكلاء متخصصين مبنيون كرسوم فرعية (subgraphs) قابلة للتركيب، ويعملون بالعربية والإنجليزية.
  4. النموذج. نموذج Qwen يخدّمه vLLM على بنية تحتية من معالجات A100.
  5. الاسترجاع. بحث هجين لـ RAG: نتائج المتجهات وBM25 يعيد LLM ترتيبها.
  6. البحث في الويب. عبر تكامل Brave Search باستخدام MCP.
  7. التخزين المؤقت. تخزين مؤقت على مستوى العُقد مبني على SQLite.
وصف نصي للمخطط

مخطط معماري. يكتب المستخدم بالعربية أو الإنجليزية. تمر الطلبات عبر Nginx، وهو وكيل عكسي، إلى خدمات FastAPI داخل حاويات Docker، وتستخدم الواجهات الداخلية الأساسية gRPC. داخل رسم LangGraph غير متزامن بالكامل، ينقل التوجيه القائم على Command، دون حواف ثابتة، التحكم بين ستة وكلاء متخصصين مبنيين كرسوم فرعية قابلة للتركيب. ويستدعي الرسم أربع خدمات خلفية: نموذج Qwen الذي يخدّمه vLLM على معالجات A100، واسترجاعًا هجينًا يجمع بحث المتجهات وBM25 مع إعادة ترتيب بواسطة LLM، وBrave Search عبر MCP، وذاكرة تخزين مؤقت على مستوى العُقد مبنية على SQLite.

في هذه الصفحة المشكلة
01

المشكلة

كان على روبوت المحادثة أن يجيب بالعربية والإنجليزية، وأن يعمل على نماذج ذاتية الاستضافة على خوادم A100، وأن يستند في إجاباته إلى المستندات ونتائج الويب الحية، وأن يرشد المستخدم في إعداد الخدمات عبر محادثة متعددة الجولات. وفي بيئة الإنتاج، كان على خوادم النماذج أن تتعافى تلقائيًا عند حدوث أي عطل.

02

النهج

  1. استرجاع هجين لخطوط RAG: بحث متجهي مع BM25، ثم إعادة ترتيب بنموذج لغوي، مع تخزين مؤقت عبر SQLite على مستوى عُقد المخطط.
  2. بحث حي على الويب عبر خادم Brave Search MCP.
  3. خدمة Qwen عبر vLLM على وحدات NVIDIA A100، مع تولّي دورة حياتها كاملة: إعدادات الخدمة، وتخصيص وحدات GPU، وإصدارات النماذج، ومراقبة الحالة، وإعادة التشغيل التلقائي على عدة خوادم GPU في بيئة الإنتاج.
  4. النشر كخدمات FastAPI في حاويات Docker خلف Nginx، مع CI/CD.
03

البنية

عرض للمكوّنات: وكلاء LangGraph غير متزامنين يستدعون Qwen ذاتي الاستضافة على vLLM، ويسترجعون عبر بحث هجين مع إعادة ترتيب بنموذج لغوي، ويصلون إلى الويب عبر MCP، فيما تعمل خدمات FastAPI خلف Nginx. الشكل 1

المستخدمون والواجهات
  • المستخدمون (عربي / إنجليزي)
التنسيق
  • تنسيق LangGraph · توجيه عبر Command، غير متزامن
الوكلاء
  • 6 وكلاء متخصصين · مخططات فرعية معيارية
النماذج
  • vLLM يخدم Qwen
الاسترجاع
  • بحث هجين: متجهي + BM25
  • إعادة ترتيب بنموذج لغوي
البيانات
  • تخزين مؤقت للعُقد (SQLite)
الخدمات
  • خدمات FastAPI (Docker)
  • Brave Search عبر MCP
البنية التحتية
  • Nginx
  • خوادم A100 · إصدارات، فحوص حالة، إعادة تشغيل تلقائي
الروابط بين المكوّنات
  • من المستخدمون (عربي / إنجليزي) إلى Nginx
  • من Nginx إلى خدمات FastAPI (Docker)
  • من خدمات FastAPI (Docker) إلى تنسيق LangGraph
  • من تنسيق LangGraph إلى 6 وكلاء متخصصين
  • من تنسيق LangGraph إلى تخزين مؤقت للعُقد (SQLite)
  • من 6 وكلاء متخصصين إلى بحث هجين: متجهي + BM25
  • من بحث هجين: متجهي + BM25 إلى إعادة ترتيب بنموذج لغوي
  • من 6 وكلاء متخصصين إلى Brave Search عبر MCP
  • من 6 وكلاء متخصصين إلى vLLM يخدم Qwen
  • من vLLM يخدم Qwen إلى خوادم A100
Fig. 2 hybrid-rag · architecture
استرجاع هجين مع إعادة ترتيب بواسطة LLMمخطط تدفق. يُرسَل الاستعلام بالتوازي إلى بحث BM25 بالكلمات المفتاحية وإلى بحث بالمتجهات الكثيفة عبر التضمينات. تُدمج النتائج ثم يعيد LLM ترتيبها، وتُمرَّر سياقًا إلى LLM يولّد الإجابة.PARALLELQueryBM25keywordDense vectorembeddingsMerge2LLM rerank3ContextGenerateLLM41retrieval · datamodel · LLMexternalrequest1note
استرجاع هجين مع إعادة ترتيب بواسطة LLMمخطط تدفق. يُرسَل الاستعلام بالتوازي إلى بحث BM25 بالكلمات المفتاحية وإلى بحث بالمتجهات الكثيفة عبر التضمينات. تُدمج النتائج ثم يعيد LLM ترتيبها، وتُمرَّر سياقًا إلى LLM يولّد الإجابة.PARALLELQueryBM25keywordDense vectorembeddingsMerge2LLM rerank3ContextGenerateLLM41retrieval · datamodel · LLMexternalrequest1note

الشكل 2 نمط الاسترجاع وراء أعمالي في RAG: بحث بالكلمات المفتاحية (BM25) وبحث بالمتجهات الكثيفة بالتوازي، ثم دمج النتائج وإعادة ترتيبها بواسطة LLM، وتوليد الإجابة من هذا السياق. تعرض المخططات المكوّنات المذكورة في الأوصاف المنشورة للعمل، وهي مبسّطة وليست خرائط كاملة للأنظمة.

  1. الاسترجاع. يعمل البحث بالكلمات المفتاحية (BM25) والبحث بالمتجهات الكثيفة بالتوازي.
  2. الدمج. تُدمج قائمتا النتائج في مجموعة مرشحين واحدة.
  3. إعادة الترتيب. يعيد LLM ترتيب المرشحين قبل وصولهم إلى الموجِّه (prompt).
  4. التوليد. يولّد LLM الإجابة من السياق بعد إعادة ترتيبه.
وصف نصي للمخطط

مخطط تدفق. يُرسَل الاستعلام بالتوازي إلى بحث BM25 بالكلمات المفتاحية وإلى بحث بالمتجهات الكثيفة عبر التضمينات. تُدمج النتائج ثم يعيد LLM ترتيبها، وتُمرَّر سياقًا إلى LLM يولّد الإجابة.

Fig. 3 llm-serving-a100 · architecture
خدمة نماذج LLM على معالجات A100: دورة حياة نشر النماذجمخطط معماري. التسليم: تمر الشيفرة من Git عبر CI/CD بأتمتة مكتوبة بسكربتات shell إلى صور Docker، تُرقّى من بيئة التطوير إلى بيئة الإنتاج وتُنشر على خوادم GPU الإنتاجية. وتُطبَّق على الخوادم نفسها إدارة إصدارات نماذج Qwen وإعدادات الخدمة في vLLM، بما فيها توزيع موارد GPU. الإنتاج: عدة خوادم بمعالجات A100، يشغّل كلٌّ منها vLLM مع نموذج Qwen؛ يظهر في المخطط خادمان وعنصر يمثّل البقية. يرسل وكلاء روبوت المحادثة المبني على LangGraph طلبات الاستدلال إليها. وتفحص مراقبة الصحة الخوادم، وتعيد مسارات إعادة التشغيل الآلية تشغيلها.DELIVERY · CI/CDPRODUCTION GPU SERVERSdeployGitCI/CDshell-scriptedDocker imagesdev → prodModel versionsQwen2vLLM configGPU allocation3GPU servervLLM · Qwen · A100GPU servervLLM · Qwen · A100more serversChatbot agentsLangGraphHealth monitoring5Automated restartrestart pipelines614model · LLMevaluationservice · infrastoreexternalrequestbatch · background1note
خدمة نماذج LLM على معالجات A100: دورة حياة نشر النماذجمخطط معماري. التسليم: تمر الشيفرة من Git عبر CI/CD بأتمتة مكتوبة بسكربتات shell إلى صور Docker، تُرقّى من بيئة التطوير إلى بيئة الإنتاج وتُنشر على خوادم GPU الإنتاجية. وتُطبَّق على الخوادم نفسها إدارة إصدارات نماذج Qwen وإعدادات الخدمة في vLLM، بما فيها توزيع موارد GPU. الإنتاج: عدة خوادم بمعالجات A100، يشغّل كلٌّ منها vLLM مع نموذج Qwen؛ يظهر في المخطط خادمان وعنصر يمثّل البقية. يرسل وكلاء روبوت المحادثة المبني على LangGraph طلبات الاستدلال إليها. وتفحص مراقبة الصحة الخوادم، وتعيد مسارات إعادة التشغيل الآلية تشغيلها.DELIVERY · CI/CDPRODUCTION GPU SERVERSdeployGitCI/CDDockerimagesModel versionsQwen2vLLM configGPU allocation3GPU servervLLM · Qwen · A100GPU servervLLM · Qwen · A100more serversHealth monitoring5Automated restartrestart pipelines614model · LLMevaluationservice · infrastorerequest1notebatch · background

الشكل 3 دورة حياة كاملة لنشر نماذج Qwen عبر vLLM على عدة خوادم إنتاج بمعالجات A100: CI/CD والحاويات، وإصدارات النماذج، وإعدادات الخدمة وتوزيع موارد GPU، ومراقبة الصحة وإعادة التشغيل الآلية. تعرض المخططات المكوّنات المذكورة في الأوصاف المنشورة للعمل، وهي مبسّطة وليست خرائط كاملة للأنظمة.

  1. التسليم. CI/CD ونشر عبر الحاويات باستخدام Docker وGit وأتمتة بسكربتات shell، في بيئتي التطوير والإنتاج.
  2. الإصدارات. إدارة إصدارات نماذج Qwen في بيئة الإنتاج.
  3. الخدمة. إعدادات الخدمة في vLLM وتوزيع موارد GPU.
  4. خوادم GPU. عدة خوادم إنتاج بمعالجات NVIDIA A100 تعمل بـ vLLM.
  5. المراقبة. مراقبة صحة الخدمة عبر خوادم GPU.
  6. التعافي. مسارات آلية لإعادة التشغيل.
وصف نصي للمخطط

مخطط معماري. التسليم: تمر الشيفرة من Git عبر CI/CD بأتمتة مكتوبة بسكربتات shell إلى صور Docker، تُرقّى من بيئة التطوير إلى بيئة الإنتاج وتُنشر على خوادم GPU الإنتاجية. وتُطبَّق على الخوادم نفسها إدارة إصدارات نماذج Qwen وإعدادات الخدمة في vLLM، بما فيها توزيع موارد GPU. الإنتاج: عدة خوادم بمعالجات A100، يشغّل كلٌّ منها vLLM مع نموذج Qwen؛ يظهر في المخطط خادمان وعنصر يمثّل البقية. يرسل وكلاء روبوت المحادثة المبني على LangGraph طلبات الاستدلال إليها. وتفحص مراقبة الصحة الخوادم، وتعيد مسارات إعادة التشغيل الآلية تشغيلها.

04

النتيجة

  • النشر في بيئة الإنتاج نظامًا غير متزامن بالكامل وثنائي اللغة (عربي/إنجليزي).
  • خدمة نماذج ذاتية الاستضافة مع مراقبة الحالة وإعادة التشغيل التلقائي على عدة خوادم GPU في بيئة الإنتاج.
  • إجابات تستند إلى المستندات المسترجعة ونتائج الويب الحية.
05

التقنيات

التنسيق
LangGraph
النماذج
QwenvLLM
الاسترجاع
BM25Brave Search
البيانات
SQLite
الخدمات
FastAPIMCP
خطوط المعالجة
CI/CD
البنية التحتية
NVIDIA A100DockerNginx

مصادر هذه المعلومات. كل ما في هذه الصفحة مأخوذ من سيرتي الذاتية وملفي على LinkedIn وملفي ومستودعاتي على GitHub. لا شيء هنا تقديري: وحين لا يوجد رقم منشور، تصف الصفحة ما يفعله النظام.

اسحب للتنقل، وباعد بإصبعين للتكبير.

تابع القراءة

أسئلة عن هذا العمل؟

اسأل مساعدي الذكي عن «روبوت محادثة من 6 وكلاء على vLLM».

يجيب من سيرتي الذاتية وملفاتي المنشورة، بالعربية أو الإنجليزية.