كيف يعمل DeepSeek V4 Pro بدون وحدات GPU من Nvidia

يحقق DeepSeek V4 Pro أداءً تنافسيًا بمستوى النماذج الرائدة دون أجهزة Nvidia، عبر الجمع بين التفعيل المتفرّق لمزيج الخبراء، وضغط ذاكرة KV بالانتباه الكامن متعدد الرؤوس، والتدريب بالدقة المختلطة FP8 على شرائح AMD Radeon Instinct وHuawei Ascend.

كيف يعمل DeepSeek V4 Pro بدون وحدات GPU من Nvidia
Cristian Da Conceicao
مؤسس Picasso IA

يعمل DeepSeek V4 Pro على أجهزة تصنعها منافسو Nvidia، وهو لا يواجه صعوبة في ذلك. هذه هي القصة التي تستحق الاهتمام.

لسنوات، كان الافتراض السائد في تطوير الذكاء الاصطناعي بسيطًا: النماذج الجادة تتطلب وحدات H100 أو A100 من Nvidia. CUDA هو معيار الحوسبة، وكل ما عداه حلّ التفافي يكلّف الأداء. كسر DeepSeek V4 Pro هذا الافتراض، إذ أطلق نموذجًا لغويًا كبيرًا من الطراز الرائد، دُرّب ويُشغَّل بشكل أساسي على أجهزة AMD Radeon Instinct و Huawei Ascend. هذه ليست مجرد قصة عن سلسلة التوريد أو هامش جيوسياسي. إنها إنجاز معماري عميق.

لفهم كيف يحقق DeepSeek V4 Pro ذلك، يلزم النظر في ثلاثة خيارات تصميمية أساسية: بنية مزيج الخبراء (MoE)، وآلية الانتباه الكامن متعدد الرؤوس (MLA)، واستراتيجية التدريب بالدقة المختلطة FP8. معًا، أزالت هذه القرارات المعمارية الاعتماد الصارم على مجموعة برمجيات CUDA الملكية من Nvidia، وخفّضت بشكل كبير عرض النطاق الترددي للذاكرة والميزانية الحاسوبية المطلوبة للتدريب والتشغيل على حد سواء.

مشكلة العتاد التي سعى DeepSeek إلى حلها

فرضت ضوابط التصدير الحكومية الأمريكية على أشباه الموصلات المتقدمة، وخاصة وحدات H100 و A100 من Nvidia، قيودًا كبيرة على الأجهزة في مؤسسات البحث الصينية في مجال الذكاء الاصطناعي. كانت الردود الواضحة هي الانتظار، أو الضغط للحصول على استثناءات، أو تأمين الشرائح عبر قنوات طرف ثالث. أما رد DeepSeek فكان معماريًا: تصميم نموذج لا يحتاج إلى تلك الشرائح ليؤدي بمستوى تنافسي.

يتطلب تنفيذ هذه الاستراتيجية إعادة النظر في الافتراضات في كل طبقة من مجموعة الأدوات. مجموعة أدوات CUDA التي تتحكم فيها Nvidia هي المعيار الفعلي لطبقة الحوسبة في كل عملية تدريب كبيرة لنموذج لغوي كبير تقريبًا خارج الصين. الابتعاد عن CUDA يعني كتابة نوى التدريب وتحسينها لمجموعة أدوات ROCm من AMD، أو لإطار CANN (Compute Architecture for Neural Networks) من Huawei. الإطاران قادران، لكن لا أيٍّ منهما يملك نضج النظام البيئي الذي راكمته CUDA على مدى 15 عامًا من الاستثمار المجتمعي والتجاري.

لم يكن التحدي الهندسي مجرد نقل الشيفرة إلى API مختلف. كان الأمر يتعلق بإثبات أن النموذج الناتج، الذي دُرِّب بأدوات أقل مثالية وعلى شرائح تبدو أدنى في المواصفات القصوى على الورق، يمكن أن يكون منافسًا للنماذج المدرَّبة على أفضل الأجهزة المتاحة. تجاوز DeepSeek V4 Pro هذا المعيار، وأظهر بذلك أن العلاقة بين جودة الأجهزة وجودة النموذج أقل حتمية مما افترضته الصناعة.

لقطة مقربة جدًا لشريحة المسرّع AMD Radeon Instinct MI300X GPU

نظرة سريعة على بنية DeepSeek V4 Pro

DeepSeek V4 Pro هو نموذج مزيج الخبراء (MoE) يضم نحو 671 مليار معامل إجمالي، لكن يُفعَّل منها حوالي 37 مليارًا فقط في كل تمريرة أمامية. هذه الفجوة بين المعاملات الإجمالية والنشطة هي أهم رقم منفرد في هذه البنية.

المواصفةالقيمة
إجمالي المعاملات~671 مليار
المعاملات النشطة لكل توكن~37 مليار
نوع البنيةمزيج خبراء متفرّق
دقة التدريبFP8
آلية الانتباهالانتباه الكامن متعدد الرؤوس (MLA)
نافذة السياق128,000 توكن

الفجوة الكبيرة بين المعاملات الإجمالية والنشطة هي ما يتيح تشغيل DeepSeek V4 Pro على أجهزة كانت ستنهار تحت حمل نموذج كثيف بحجم 671 مليار معامل. كل تمريرة أمامية لا تستخدم سوى جزء مختار بعناية من سعة النموذج، ما يخفّض بشكل كبير متطلبات عرض النطاق الترددي للذاكرة وكثافة الحوسبة لكل توكن يُولَّد.

💡 جدير بالملاحظة: عرض النطاق الترددي للذاكرة، لا عدد عمليات FLOPS الخام، هو عنق الزجاجة الأساسي لتشغيل النماذج اللغوية الكبيرة على نطاق واسع. وبتفعيل 5.5% فقط من معاملاته لكل توكن، يجعل DeepSeek V4 Pro كل منصة عتاد مضيفًا أكثر جدوى.

لماذا يغيّر مزيج الخبراء معادلة العتاد

ما الذي يفعله MoE فعلًا

في المحوّل الكثيف التقليدي (dense transformer)، تشارك كل معاملة في تنبؤ كل توكن. يعالج نموذج كثيف بحجم 70B كل توكن عبر معاملاته البالغة 70 مليارًا، في كل مرة دون استثناء. أما في نموذج MoE، فتنقسم الشبكة إلى كثير من شبكات "الخبراء" الفرعية المتخصصة، ويختار موجّه متعلَّم أي الخبراء يعالج كل توكن، بناءً على محتوى التوكن وسياقه.

يستخدم DeepSeek V4 Pro تصميم MoE دقيق الحبيبات يضم خبراء مشتركين وخبراء موجَّهين معًا. يُفعَّل الخبراء المشتركون دائمًا بغض النظر عن محتوى التوكن، ويتولون المعرفة العامة والأنماط اللغوية الشائعة. أما الخبراء الموجَّهون فيتنافسون على التفعيل عبر شبكة موجّه خفيفة تضيف عبئًا حوسبيًا ضئيلًا إلى كل تمريرة أمامية. ولا يعالج كل توكن سوى الخبراء الفائزين فعليًا.

منظر جوي من الأعلى لمجموعة لوحات دوائر مطبوعة مترابطة تمثّل حوسبة MoE الموزعة

لماذا يهم هذا بالنسبة للعتاد غير Nvidia

تهيمن H100 من Nvidia على تدريب الذكاء الاصطناعي جزئيًا لأن تدريب النماذج الكثيفة الكبيرة يتطلب عرض نطاق ترددي شديد الإحكام للاتصال بين وحدات GPU أثناء مرحلة الانتشار العكسي (backward pass)، و NVLink (وصلة GPU الملكية من Nvidia) يتفوق على وصلات الربط البديلة بهامش كبير. تقلل نماذج MoE هذا الحجم من الاتصال بشكل كبير أثناء التدريب: إذ لا تتلقى سوى الخبراء المفعّلين تحديثات التدرج، ولا تحتاج سوى معاملات هؤلاء الخبراء إلى الانتقال عبر وصلة الربط في كل خطوة.

هذا يجعل التدريب عبر InfiniBand، وهو محايد للعتاد، أكثر تنافسية بكثير مقارنةً مع NVLink. تستخدم مجموعات AMD MI300X و مجموعات Huawei Ascend 910B كلتيهما InfiniBand أو وصلات مكافئة، وكلتاهما تتعامل مع نمط اتصال MoE بكفاءة كافية دون تحمّل عقوبة غياب NVLink التي تتكبدها النماذج الكثيفة.

أثناء تشغيل النموذج، تُوزّع نماذج MoE شرائح الخبراء على وحدات GPU. تستضيف كل وحدة GPU مجموعة فرعية من شبكة الخبراء، وتتلقى فقط التوكنات الموجَّهة إلى خبرائها. وهذا نمط توازٍ محايد للعتاد بطبيعته، ينطبق بسلاسة على عتاد AMD و Ascend دون أي عيب جوهري.

شرح مبسط لآلية الانتباه الكامن متعدد الرؤوس

مشكلة عنق الزجاجة في الانتباه

يخزّن الانتباه متعدد الرؤوس القياسي (MHA) ذاكرة تخزين مؤقت للمفاتيح والقيم (KV cache) تنمو بالتناسب مع طول التسلسل. مع نافذة سياق تبلغ 128,000 توكن، تصبح هذه الذاكرة ضخمة، وتستهلك ذاكرة تحدّ مباشرة من عدد الطلبات المتزامنة التي يمكن خدمتها على مجموعة معينة من وحدات GPU.

تكمن ميزة Nvidia في العتاد عند تشغيل السياقات الطويلة جزئيًا في سعة HBM الخام، إذ تأتي وحدات H100 بسعة 80GB من HBM3. تمتلك كثير من إعدادات AMD و Ascend سعة مماثلة أو أكبر لكل وحدة في أحدث الأجيال، لكن نمو ذاكرة KV عند سياقات 128K يمكن أن يبلغ حدود أي عتاد عند تشغيل MHA القياسي على نطاق واسع.

باحثو ذكاء اصطناعي يدرسون مخططات البنية العصبية على لوح أبيض

كيف تحلّ MLA المشكلة

الانتباه الكامن متعدد الرؤوس (MLA) يضغط ذاكرة KV المؤقتة بإسقاط المفاتيح والقيم إلى فضاء كامن منخفض الأبعاد قبل تخزينها، ثم يفك ضغط التمثيلات الكامنة فورًا أثناء حساب الانتباه. لا تُخزَّن مصفوفات المفاتيح والقيم كاملة الرتبة في الذاكرة في حالة السكون أبدًا، بل المتجهات الكامنة المضغوطة فقط.

والنتيجة ذاكرة KV مؤقتة أصغر بمقدار 5 إلى 13 مرة من MHA القياسي عند أطوال السياق نفسها. وهذا ليس تحسينًا طفيفًا. إنه الفرق بين خدمة طلبات سياق 128K على عتاد يضم 64GB من HBM، وبين الحاجة إلى تهيئات تبلغ 320GB أو أكثر لحجم العمل نفسه.

💡 الأثر العملي: يستهلك نموذج يخدم نوافذ سياق 128K مع MLA قدرًا من ذاكرة KV يعادل تقريبًا ما يستهلكه نموذج قياسي يخدم سياقات من 10,000 إلى 25,000 توكن. يمكن لعتاد AMD و Ascend خدمة طلبات السياق الطويل التي كانت ستتطلب ميزانيات VRAM بمستوى H100.

يحافظ تنفيذ DeepSeek لآلية MLA على جودة المخرجات عبر تصميم دقيق لمصفوفات الإسقاط. يتم تعلّم الضغط أثناء التدريب بدلًا من تطبيقه بعد ذلك، لذا تتكيف تمثيلات النموذج منذ البداية لتعمل بفعالية داخل الفضاء الكامن المضغوط.

تدريب FP8: إنجاز المزيد بموارد أقل

ما معنى دقة الفاصلة العائمة

اعتمد تدريب النماذج الكبيرة تقليديًا على FP32 (فاصلة عائمة 32 بت) أو FP16 (16 بت). تقلل الدقة المنخفضة البصمة الذاكرية وتزيد الإنتاجية، لأن أرقامًا أكثر تتسع في الذاكرة نفسها، وتكتمل العمليات أسرع على وحدات عتاد مخصصة للدقة المنخفضة. ويذهب FP8 (8 بت) أبعد من ذلك، إذ يستخدم 8 بتات فقط لكل رقم.

يكمن التحدي في الدقة المنخفضة في استقرار العمليات العددية. أثناء التدريب، قد تتلاشى تدرجات صغيرة جدًا إلى الصفر (underflow)، وقد تفيض التفعيلات الكبيرة جدًا إلى ما لا نهاية. كلتا الظاهرتين تُفسد التدريب. إن جعل FP8 مستقرًا عبر مئات المليارات من المعاملات مشكلة هندسية صعبة حقًا، تجنّبتها معظم فرق البحث لسنوات.

مهندس يراقب مقاييس دقة تدريب FP8 على محطة عمل بثلاث شاشات

كيف جعل DeepSeek FP8 مستقرًا

تستخدم استراتيجية تدريب FP8 لدى DeepSeek مخططًا بالدقة المختلطة، حيث تبقى العمليات الحساسة، وتحديدًا تراكم التدرجات وتخزين الأوزان الرئيسية، في دقة أعلى (BF16 أو FP32)، بينما تُنفَّذ عمليات ضرب المصفوفات المهيمنة حوسبيًا بدقة FP8. طوّر الفريق استراتيجيات تحجيم ديناميكية مخصصة تتكيف مع إحصاءات التدرج المرصودة طوال التدريب، ما يمنع عدم الاستقرار العددي الذي أفسد محاولات FP8 السابقة على نطاق كبير.

هذا مهم لاستقلالية العتاد لثلاثة أسباب متمايزة:

  • FP8 ليس تقنية ملكية لشركة Nvidia: على عكس صيغة TF32 من Nvidia، FP8 معيار مفتوح مدعوم أصلًا في AMD MI300X وبشكل متزايد في عتاد Ascend، ما يعني أن مكاسب الإنتاجية متاحة خارج منظومة CUDA.
  • يتراجع ضغط الذاكرة بشكل حاد: يتطلب تدريب FP8 تقريبًا نصف ذاكرة FP16 لنفس حجم النموذج، ما يجعل من الممكن تركيب طبقات نموذج أكثر على كل وحدة GPU في العتاد المحدود الذاكرة.
  • ترتفع الإنتاجية تقريبًا إلى الضعف على السيليكون المدعوم: على العتاد الذي يمتلك نوى موترات FP8 أصلية، ومنها AMD MI300X، تقترب إنتاجية كل شريحة من ضعف معدل FP16 في عمليات ضرب المصفوفات المقيّدة بالحوسبة.

المهم هو التأثير المتراكم عبر الابتكارات الثلاثة: يقلل التفعيل المتفرّق في MoE الحوسبة لكل توكن بمقدار 18 مرة، ويقلل MLA البصمة الذاكرية للسياقات الطويلة بمقدار 5 إلى 13 مرة، ويخفّض تدريب FP8 تكلفة الذاكرة والحوسبة لكل خطوة تدريب إلى النصف. معًا، ينقلون نقطة التشغيل الفعّالة للنموذج إلى عتاد كان سيكون غير كافٍ تمامًا لنموذج رائد من 671 مليار معامل.

لماذا تنجح وحدات AMD و Huawei Ascend GPU هنا

تفاصيل AMD Radeon Instinct MI300X

AMD Radeon Instinct MI300X ليست شريحة من الدرجة الثانية. تأتي بسعة 192GB من HBM3 لكل وحدة، أي أكثر من ضعف سعة 80GB في H100. بالنسبة لأحمال تشغيل النموذج حيث تمثل ذاكرة KV العامل الأول المقيّد، تُعد سعة الذاكرة في MI300X ميزة على H100 في إعدادات محددة.

ما ينقص AMD هو CUDA. ROCm، مجموعة الأدوات الحوسبية من AMD، ناضجة بما يكفي لتشغيل النماذج وتزداد قدرة على التدريب، لكنها احتاجت تاريخيًا إلى جهد هندسي إضافي لتضاهي تجربة المطورين الجاهزة لدى Nvidia. استثمر فريق DeepSeek في هذا العمل مباشرة، فبنى نوى تدريب ومشغّلات انتباه محسّنة خصيصًا لنموذج البرمجة في ROCm.

شريحة المسرّع Huawei Ascend 910B مركّبة في هيكل خادم مفتوح

تفاصيل Huawei Ascend 910B

Huawei Ascend 910B يقدم نحو 256 TFLOPS عند FP16، وهو أقل بكثير من 989 TFLOPS التي تحققها H100 على الورق. يعمل على إطار CANN من Huawei بدلًا من CUDA أو ROCm، ما يعني أن سلسلة الأدوات تتطلب عمل تحسين منفصلًا. درّب DeepSeek أجزاءً كبيرة من الإصدارات السابقة وسلالة V4 Pro على مجموعات Ascend 910B.

تخفّف المنظومة المكوّنة من MoE و MLA و FP8 بشكل مباشر من قيود عتاد Ascend. تصبح شريحة ذات عرض نطاق ترددي للذاكرة وذروة FLOPS أدنى أكثر تنافسية بكثير عندما لا يفعّل النموذج الذي تشغّله سوى 5.5% من معاملاته لكل توكن، ويضغط ذاكرة الانتباه المؤقتة بمقدار 5 إلى 13 مرة. فالفجوة في العتاد على الورق أكبر بكثير من فجوة الأداء في الواقع.

العتادVRAMذروة TFLOPS عند FP16مجموعة الأدوات الحوسبية
Nvidia H10080GB HBM3989CUDA (ناضجة)
AMD MI300X192GB HBM31,307ROCm (قيد التطوير)
Huawei Ascend 910B64GB HBM2e256CANN (ملكية)

ماذا يعني هذا لوصول الذكاء الاصطناعي

تغيّرت معادلة التكلفة

تُؤجَّر مجموعات H100 بسعر يتراوح بين $2.00 إلى $4.50 لكل ساعة GPU، حسب المزوّد والمنطقة. تكون مجموعات AMD MI300X عادة أرخص بنسبة 20 إلى 40 بالمئة في إعدادات مكافئة. أما الحوسبة السحابية المعتمدة على Ascend في الصين فأقل من ذلك. عندما تُنفَّذ عمليات التدريب بتنافسية على هذه المنصات، تنخفض تكلفة كل توكن تدريب بشكل ملحوظ.

أبلغ DeepSeek عن تدريب نموذجه السابق V3 بتكلفة حوسبة نحو $5.6 مليون، وهي جزء ضئيل مما تكلفه النماذج الكثيفة المماثلة من المختبرات الغربية في الفئة القدراتية نفسها. تُعد الخيارات المعمارية الموصوفة أعلاه السبب الرئيسي لذلك.

منشأة لوجستية لأشباه الموصلات مع فنيين في غرفة نظيفة يتعاملون مع رقائق السيليكون

الأوزان المفتوحة وما تغيّره

تنشر DeepSeek أوزان نموذجها علنًا. هذا يعني أن أي مؤسسة تملك وصولًا إلى عتاد AMD أو Ascend، أو حتى عناقيد GPU استهلاكية تشغّل نسخًا مكمّاة (quantized)، يمكنها الاستفادة من قدرات نموذج من الطراز الرائد دون تخصيص من Nvidia، أو تراخيص تصدير، أو حصص سحابية خاصة باهظة الثمن.

يشكّل الأثر المشترك للكفاءة المعمارية والإصدار المفتوح تحولًا ملحوظًا في من يستطيع الوصول إلى الذكاء الاصطناعي التنافسي ونشره. فالمؤسسات التي لم تكن قادرة على تحمّل كلفة الوصول إلى H100 أصبحت تشغّل نماذج DeepSeek على عتاد تملكه أصلًا، بجودة تشغيل بلغت مستوى لم يكن متاحًا لها ببساطة قبل عام.

الإشارة الأوسع

استندت استراتيجية ضوابط التصدير المتعلقة بشرائح Nvidia إلى افتراض أن قطع الوصول إلى أشباه الموصلات المتقدمة سيعمل كسقف صلب أمام تطور الذكاء الاصطناعي خارج الدول المستهدفة. يُعد DeepSeek V4 Pro دليلًا ملموسًا على أن الابتكار المعماري يستطيع أن يعوّض جزئيًا قيود العتاد، بطرق تغيّر السقف الفعلي بشكل كبير. النموذج ليس مطابقًا لما كان سينتجه وصول غير محدود إلى H100، لكنه تنافسي بما يكفي ليكون مؤثرًا عبر طيف واسع من أحمال العمل الحقيقية.

يغيّر هذا حسابات سياسة الشرائح، واستراتيجية المنافسة في الذكاء الاصطناعي، وما يعنيه عمليًا «الوصول إلى الذكاء الاصطناعي الرائد» للمؤسسات التي لا تملك ميزانيات سحابية ضخمة أو علاقات تفضيلية مع موردي Nvidia.

عمود رف خوادم بكابلات ألياف ضوئية منظمة مصوّر من الأسفل

استخدم DeepSeek على PicassoIA الآن

تستضيف PicassoIA عدة نماذج من DeepSeek في مجموعة Large Language Models الخاصة بها، ما يمنحك وصولًا فوريًا دون إدارة البنية التحتية أو تجهيز العتاد:

  • DeepSeek R1: نموذج يركز على الاستدلال عبر سلسلة التفكير، مع تفكيك المسائل خطوة بخطوة. الأفضل للتحليل التقني والرياضيات والمهام التي تعتمد بكثافة على المنطق حيث يكون إظهار عملية التفكير مهمًا.
  • DeepSeek V3: نموذج الطراز الرائد الفعّال لتوليد النصوص والبرمجة بشكل عام. أداء قوي ومتوازن بزمن استجابة منخفض.
  • DeepSeek V3.1: إصدار محدّث بمتابعة أدق للتعليمات وأداء أفضل في اختبارات البرمجة المعيارية.

يوفر PicassoIA أيضًا الوصول إلى Qwen3 235B A22B Instruct، و Llama 4 Maverick Instruct، و Claude Opus 4.7، و GPT 5، و Kimi K2 Instruct في الواجهة نفسها، ما يتيح لك مقارنة المخرجات عبر طيف النماذج الرائدة دون إدارة حسابات متعددة أو مفاتيح API.

القصة المعمارية وراء DeepSeek V4 Pro هي أن التصميم الفعّال يمكن أن يحل محل الاستثمار بالقوة الغاشمة في العتاد. المبدأ نفسه ينطبق على طريقة عملك مع الذكاء الاصطناعي: لا تحتاج دائمًا إلى أكبر نموذج على أغلى عتاد. تحتاج إلى النموذج المناسب، المطبّق على المسألة المناسبة، مع الأمر النصي المناسب.

فريق بحث متنوع في الذكاء الاصطناعي يراجع مخرجات النماذج حول طاولة اجتماعات

افتح DeepSeek R1 أو DeepSeek V3.1 على PicassoIA، وأعطه مهمة تهمّ عملك، ولاحظ ما الذي يقدمه الذكاء الاصطناعي الرائد المستقل عن العتاد فعليًا. البنية التي جعلته ممكنًا دون وحدات Nvidia GPU هي، في هذه الحالة، ما يجعله متاحًا على نطاق واسع لك أيضًا.

شخص يستخدم واجهة دردشة للذكاء الاصطناعي على حاسوب محمول في مقهى مضيء

شارك هذا المقال

اختر لغتك

مقالات ذات صلة