تدريب نموذج لغوي على بياناتك وعلى جهازك أو خوادمك الخاصة لم يعد حكراً على المختبرات الكبرى. بفضل النماذج مفتوحة الأوزان وتقنيات التدريب الموفّرة للذاكرة، يمكن لفريق صغير أن يخصّص نموذجاً بحجم 7 إلى 14 مليار معامل على بطاقة رسومية واحدة. يشرح هذا التقرير الطرق المتاحة، ومتى تستخدم كل طريقة، وما الذي تحتاجه فعلاً.

أولاً: هل تحتاج فعلاً إلى تدريب نموذج؟

قبل أي استثمار في العتاد، اسأل نفسك: ما المشكلة التي أريد حلها؟ كثير من الحالات تُحل بطريقة أرخص من التدريب.

الحاجةالحل الأنسبالسبب
إجابات من وثائق الشركة المتغيرةRAGالمعرفة تبقى خارج النموذج وتُحدَّث دون إعادة تدريب
أسلوب كتابة أو نبرة محددةFine-tuning (SFT)السلوك يُحقَن في الأوزان
مخرجات بصيغة JSON ثابتة أو مهمة ضيقة متكررةFine-tuningنموذج صغير مدرَّب قد يضاهي نموذجاً كبيراً بتكلفة أقل
خصوصية تامة أو بيئة بلا إنترنتنموذج محلي + RAG أو SFTلا تخرج البيانات من بنيتك
إتقان لغة أو مجال لا يعرفه أي نموذجContinued pre-trainingيتطلب بيانات ضخمة وموارد أكبر بكثير

ثانياً: طرق التدريب الأربع

1. التدريب من الصفر (Pre-training)

بناء نموذج من أوزان عشوائية على تريليونات الرموز (tokens). يتطلب مئات أو آلاف وحدات GPU لأسابيع، وهو غير واقعي لمعظم الشركات. يُستخدم فقط عند الحاجة إلى نموذج صغير جداً لمجال بالغ التخصص أو لأغراض البحث.

2. التدريب المستمر (Continued Pre-training)

متابعة تدريب نموذج جاهز على نصوص خام كثيرة من مجالك (قانون، طب، لهجة معينة). يحسّن "طلاقة" النموذج في المجال، لكنه يحتاج كمية بيانات كبيرة ويخاطر بما يسمى النسيان الكارثي (Catastrophic Forgetting) إذا لم يُمزج مع بيانات عامة.

3. الضبط الدقيق الكامل (Full Fine-tuning)

تحديث جميع أوزان النموذج على أزواج تعليمات وإجابات. أعلى جودة محتملة، لكنه يحتاج ذاكرة تعادل عدة أضعاف حجم النموذج بسبب حالات المُحسِّن (Optimizer states) والتدرجات.

4. الضبط الفعّال للمعاملات (PEFT): LoRA و QLoRA

تجمّد أوزان النموذج الأصلي وتضيف مصفوفات صغيرة قابلة للتدريب (Adapters) بمرتبة منخفضة. النتيجة: تدريب أقل من 1% من المعاملات، وملف Adapter بحجم عشرات الميغابايتات. أما QLoRA فتحمّل النموذج الأساسي بدقة 4-bit وتدرّب الـ Adapters فوقه، فيصبح تدريب نموذج 7B ممكناً على بطاقة بذاكرة 12–16 غيغابايت.

ثالثاً: متطلبات العتاد

الأرقام التالية تقديرية وتتغير بحسب طول السياق وحجم الدفعة (batch size) والأداة المستخدمة، لكنها تعطيك تصوراً أولياً للتخطيط.

حجم النموذجالاستدلال 4-bitQLoRA (تقريباً)ضبط كامل (fp16)
3B – 4B~3 GB8 GB~40 GB+
7B – 8B~5 GB12 – 16 GB~100 GB+
13B – 14B~9 GB20 – 24 GBعدة بطاقات
30B – 34B~20 GB40 – 48 GBعدة بطاقات
70B~40 GB80 GB أو بطاقتانعنقود GPU
  • ذاكرة الفيديو (VRAM) هي العامل الحاسم، وليست قوة المعالج.
  • بطاقات NVIDIA هي الأكثر دعماً (CUDA). أجهزة Apple Silicon تصلح للتجارب عبر MLX، وAMD عبر ROCm بدعم متفاوت.
  • إن لم تملك عتاداً، استأجر GPU بالساعة للتدريب ثم انشر النموذج الناتج محلياً. التدريب يحدث مرة والاستدلال يستمر.

رابعاً: خط سير العمل الكامل

  1. تحديد المهمة ومقياس النجاح: ما الذي يعتبر إجابة جيدة؟ جهّز 50–200 مثال تقييم قبل أي تدريب.
  2. اختيار النموذج الأساسي: Llama، Qwen، Mistral، Gemma. للعربية جرّب Qwen أولاً فهو من أقوى المفتوحة في دعمها. تحقّق من ترخيص النموذج.
  3. تجهيز البيانات: جودة 1,000 مثال نظيف أفضل من 50,000 مثال مشوَّش. راجع دليل تجهيز بيانات التدريب.
  4. التدريب بـ QLoRA أو LoRA. التفاصيل البرمجية في شرح QLoRA خطوة بخطوة.
  5. التقييم: قارن مع النموذج الأساسي على أمثلة لم يرها أثناء التدريب، وراجع يدوياً.
  6. الدمج والتحويل: ادمج الـ Adapter في النموذج أو حوّله إلى صيغة GGUF للتشغيل المحلي.
  7. النشر والمراقبة: راجع مقارنة أدوات التشغيل المحلي وراقب الجودة على بيانات حقيقية.

خامساً: الأدوات الأكثر استخداماً

الأداةمتى تختارها
Hugging Face TRL + PEFTمرونة كاملة وكود واضح؛ هي الأساس الذي تبنى عليه أدوات أخرى
Unslothتدريب أسرع واستهلاك ذاكرة أقل على بطاقة واحدة
Axolotlإعدادات YAML جاهزة وتجارب متكررة بدل كتابة الكود
LLaMA-Factoryواجهة ويب وإعدادات لعشرات النماذج
MLX-LMالتدريب على أجهزة Apple Silicon

سادساً: أخطاء شائعة

  • الإفراط في التدريب (Overfitting): النموذج يحفظ الأمثلة ويفقد قدرته العامة. راقب خسارة التحقق (validation loss) وأوقف مبكراً.
  • قالب محادثة خاطئ: كل نموذج له Chat Template. استخدام قالب مختلف عن قالب النموذج يدمّر الجودة بصمت.
  • تسرب بيانات التقييم إلى بيانات التدريب فتبدو النتائج أفضل من الواقع.
  • تدريب لحقن معلومات متغيرة: الحقائق التي تتغير مكانها RAG لا الأوزان.
  • إهمال الأمان والترخيص: تأكد من حقك في استخدام البيانات، ومن إزالة المعلومات الشخصية.

الخلاصة

المسار الواقعي لمعظم المؤسسات: نموذج مفتوح بحجم 7–14B، بيانات نظيفة بالآلاف لا بالملايين، تدريب QLoRA يوماً واحداً أو أقل، تقييم صارم، ثم نشر محلي. إن أردت أن نختصر عليك الطريق، فريقنا يقدّم خدمة LLM Fine-Tuning كاملة من تجهيز البيانات حتى النشر.

أسئلة شائعة

كم أحتاج من البيانات لتدريب نموذج LLM؟

لتخصيص السلوك أو الأسلوب عبر SFT تكفي عادةً من بضع مئات إلى بضعة آلاف من الأمثلة عالية الجودة. الجودة والتنوع أهم من الكمية.

هل يمكن تدريب نموذج LLM على بطاقة رسومية واحدة؟

نعم، باستخدام QLoRA يمكن ضبط نموذج بحجم 7B إلى 8B على بطاقة بذاكرة تتراوح بين 12 و16 غيغابايت، مع تحديد طول السياق وحجم الدفعة بعناية.

ما الفرق بين LoRA و QLoRA؟

LoRA تدرّب مصفوفات صغيرة فوق نموذج مجمّد بدقته الأصلية، أما QLoRA فتحمّل النموذج المجمّد بدقة 4-bit لتوفير الذاكرة ثم تدرّب نفس المصفوفات.

تريد تطبيق ذلك في مشروعك؟

فريقنا يساعدك من التخطيط حتى التشغيل. احجز استشارة مجانية.