بعد ضبط النموذج تأتي مرحلة تشغيله. اختيار أداة التشغيل يحدد تكلفتك وزمن الاستجابة وعدد المستخدمين الذين يمكنك خدمتهم. هذه مقارنة عملية بين الأدوات الثلاث الأشهر.

Ollamallama.cppvLLM
السهولةالأعلى: أمر واحدمتوسطةتحتاج GPU وإعداداً
العتادCPU و GPU و Apple SiliconCPU و GPU و Apple SiliconGPU (NVIDIA بالدرجة الأولى)
الصيغةGGUF عبر ModelfileGGUFSafetensors (Hugging Face)
عدة مستخدمين بالتزامنمحدودجيد مع إعدادممتاز (Continuous batching)
الأنسب لـالتطوير والتجارب وأجهزة المكاتبتحكم دقيق وأجهزة محدودةالإنتاج بحمل عالٍ

Ollama: الأسرع للبدء

يُنزّل النماذج ويشغّلها كخدمة محلية بواجهة REST. مناسب للتجارب ولأدوات داخلية بحمل خفيف.

bash
ollama pull qwen2.5:7b
ollama run qwen2.5:7b "عرّف RAG في جملة"

لتشغيل نموذجك المضبوط، أنشئ ملف Modelfile يشير إلى ملف GGUF:

bash
# Modelfile
FROM ./mit-merged-Q4_K_M.gguf
PARAMETER temperature 0.3
SYSTEM "أنت Mit، المساعد الرقمي لشركة Mit AI Technology."

# ثم:
ollama create mit-assistant -f Modelfile
ollama run mit-assistant

llama.cpp: تحكم كامل وأجهزة متواضعة

المحرك الذي بُنيت عليه أدوات كثيرة. يوفّر llama-server خادماً بواجهة متوافقة مع OpenAI، ويدعم مستويات تكميم متعددة (Q4_K_M توازن جيد بين الحجم والجودة) وتفريغ جزء من الطبقات إلى GPU.

bash
llama-server -m mit-merged-Q4_K_M.gguf --port 8080 -c 4096 -ngl 99

vLLM: الإنتاج بحمل عالٍ

مصمَّم لخدمة عدد كبير من الطلبات المتزامنة بكفاءة عالية عبر الدفعات المستمرة وإدارة ذاكرة KV-cache. يحتاج GPU، ويقرأ النماذج بصيغة Hugging Face.

bash
pip install vllm
vllm serve ./out/mit-merged --port 8000 --max-model-len 4096

الربط مع تطبيقك

الأدوات الثلاث تعرض واجهة متوافقة مع OpenAI، فيكفي تغيير base_url. هذه هي الطريقة التي يتصل بها الـ backend في موقعنا بنماذج Qwen المحلية (AI_PROVIDER=custom).

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="not-needed")

reply = client.chat.completions.create(
    model="./out/mit-merged",
    messages=[{"role": "user", "content": "مرحباً"}],
)
print(reply.choices[0].message.content)

أسئلة شائعة

هل يمكن تشغيل نموذج LLM بدون بطاقة رسومية؟

نعم، عبر llama.cpp أو Ollama على المعالج، مع نماذج صغيرة مكمَّمة. السرعة أقل بكثير من GPU لكنها كافية للتجارب والاستخدام الخفيف.

تريد تطبيق ذلك في مشروعك؟

فريقنا يساعدك من التخطيط حتى التشغيل. احجز استشارة مجانية.