بعد ضبط النموذج تأتي مرحلة تشغيله. اختيار أداة التشغيل يحدد تكلفتك وزمن الاستجابة وعدد المستخدمين الذين يمكنك خدمتهم. هذه مقارنة عملية بين الأدوات الثلاث الأشهر.
| Ollama | llama.cpp | vLLM | |
|---|---|---|---|
| السهولة | الأعلى: أمر واحد | متوسطة | تحتاج GPU وإعداداً |
| العتاد | CPU و GPU و Apple Silicon | CPU و GPU و Apple Silicon | GPU (NVIDIA بالدرجة الأولى) |
| الصيغة | GGUF عبر Modelfile | GGUF | Safetensors (Hugging Face) |
| عدة مستخدمين بالتزامن | محدود | جيد مع إعداد | ممتاز (Continuous batching) |
| الأنسب لـ | التطوير والتجارب وأجهزة المكاتب | تحكم دقيق وأجهزة محدودة | الإنتاج بحمل عالٍ |
Ollama: الأسرع للبدء
يُنزّل النماذج ويشغّلها كخدمة محلية بواجهة REST. مناسب للتجارب ولأدوات داخلية بحمل خفيف.
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "عرّف RAG في جملة"لتشغيل نموذجك المضبوط، أنشئ ملف Modelfile يشير إلى ملف GGUF:
# Modelfile
FROM ./mit-merged-Q4_K_M.gguf
PARAMETER temperature 0.3
SYSTEM "أنت Mit، المساعد الرقمي لشركة Mit AI Technology."
# ثم:
ollama create mit-assistant -f Modelfile
ollama run mit-assistantllama.cpp: تحكم كامل وأجهزة متواضعة
المحرك الذي بُنيت عليه أدوات كثيرة. يوفّر llama-server خادماً بواجهة متوافقة مع OpenAI، ويدعم مستويات تكميم متعددة (Q4_K_M توازن جيد بين الحجم والجودة) وتفريغ جزء من الطبقات إلى GPU.
llama-server -m mit-merged-Q4_K_M.gguf --port 8080 -c 4096 -ngl 99vLLM: الإنتاج بحمل عالٍ
مصمَّم لخدمة عدد كبير من الطلبات المتزامنة بكفاءة عالية عبر الدفعات المستمرة وإدارة ذاكرة KV-cache. يحتاج GPU، ويقرأ النماذج بصيغة Hugging Face.
pip install vllm
vllm serve ./out/mit-merged --port 8000 --max-model-len 4096الربط مع تطبيقك
الأدوات الثلاث تعرض واجهة متوافقة مع OpenAI، فيكفي تغيير base_url. هذه هي الطريقة التي يتصل بها الـ backend في موقعنا بنماذج Qwen المحلية (AI_PROVIDER=custom).
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")
reply = client.chat.completions.create(
model="./out/mit-merged",
messages=[{"role": "user", "content": "مرحباً"}],
)
print(reply.choices[0].message.content)أسئلة شائعة
هل يمكن تشغيل نموذج LLM بدون بطاقة رسومية؟
نعم، عبر llama.cpp أو Ollama على المعالج، مع نماذج صغيرة مكمَّمة. السرعة أقل بكثير من GPU لكنها كافية للتجارب والاستخدام الخفيف.
تريد تطبيق ذلك في مشروعك؟
فريقنا يساعدك من التخطيط حتى التشغيل. احجز استشارة مجانية.