DeepSeek R1: فك شفرة الابتكار الصيني الذي هز عالم الذكاء الاصطناعي
DeepSeek R1: فك شفرة الابتكار الصيني الذي هز عالم الذكاء الاصطناعي
في عالم الذكاء الاصطناعي المتسارع، لا يمر يوم دون أن نسمع عن ابتكار جديد يغير قواعد اللعبة. مؤخرًا، أحدثت شركة DeepSeek AI الصينية ضجة كبيرة بإعلانها عن نموذجها الجديد R1، وهو نموذج استدلالي مفتوح المصدر يُزعم أنه حقق أداءً يضاهي نموذج O1 من OpenAI، ولكن بجزء بسيط من التكلفة. هذا الإعلان لم يمر مرور الكرام، بل أطلق موجة من الذعر على وسائل التواصل الاجتماعي والفوضى في سوق الأسهم، حتى أن شركة Nvidia فقدت ما يقارب 600 مليار دولار من قيمتها السوقية في يوم واحد!
ولكن بالنسبة للمتابعين عن كثب لتطورات الذكاء الاصطناعي، فإن ظهور DeepSeek R1 لم يكن مفاجئًا. لقد كانت الشركة تنشر أبحاثها وتطلق أوزان نماذجها (model weights) منذ أشهر، متبعة مسارًا مشابهًا لنموذج Llama من Meta. هذا يتناقض بشكل صارخ مع مختبرات الذكاء الاصطناعي الكبرى الأخرى مثل OpenAI وGoogle DeepMind وAnthropic، التي تحتفظ بأوزان نماذجها مغلقة وتنشر تقارير فنية محدودة. ما تغير الآن هو أن الجمهور الأوسع أصبح يولي اهتمامًا حقيقيًا.
في هذه المقالة، سنفك شفرة التطورات الحقيقية الكامنة وراء DeepSeek R1 وV3، من أين أتت، ولماذا هي مهمة بهذا القدر. استعدوا لرحلة عميقة في قلب الابتكار الذي يعيد تشكيل مستقبل الذكاء الاصطناعي.
التمييز بين النماذج: DeepSeek R1 و DeepSeek V3
قبل الخوض في التفاصيل التقنية، من المهم التمييز بين النموذجين الرئيسيين اللذين أحدثا هذا الصدى: DeepSeek R1 و DeepSeek V3.
- DeepSeek V3: تم إصداره في ديسمبر الماضي، وهو نموذج أساسي للأغراض العامة (general purpose base model). يحقق أداءً يضاهي نماذج أساسية أخرى مثل GPT-4o من OpenAI، وClaude 3.5 Sonnet من Anthropic، وGemini 1.5 من Google.
- DeepSeek R1: تم إصداره في نهاية يناير، وهو نموذج استدلالي (reasoning model) مبني على DeepSeek V3. بمعنى آخر، قامت DeepSeek بأخذ نموذج V3 وطبقت عليه تحسينات خوارزمية متنوعة لتحسين قدرته على الاستدلال والمنطق. ونتيجة لذلك، حقق R1 أداءً يضاهي OpenAI O1 وGoogle Flash 2.0 في بعض معايير الاستدلال المعقدة.
العديد من الابتكارات الخوارزمية المسؤولة عن الأداء المذهل لنموذج R1 تمت مناقشتها بالفعل في ورقة V3 البحثية في ديسمبر الماضي، أو حتى قبل ذلك في ورقة DeepSeek V2 (التي نُشرت في مايو 2024)، أو ورقة DeepSeek Math (التي صدرت في فبراير 2024). لقد جمع V3 العديد من هذه الابتكارات معًا، والتي تم تصميمها في المقام الأول مع مراعاة كفاءة الحوسبة والتدريب.
العبقرية الهندسية: أسرار كفاءة DeepSeek V3
لماذا تعتبر كفاءة DeepSeek V3 أمرًا بالغ الأهمية؟ نظرًا للقيود المفروضة على الأجهزة وقيود التصدير الأمريكية على بيع وحدات معالجة الرسوميات (GPUs) إلى الصين، كان على DeepSeek أن تجد طريقة للحصول على تدريب ونطاق ترددي أكبر من مجموعتها الحالية من وحدات معالجة الرسوميات. إليك بعض الطرق الذكية التي استخدمتها DeepSeek لتحقيق أقصى استفادة من أجهزتها:
1. التدريب بصيغة الفاصلة العائمة 8 بت (FP8 Training)
إحدى الطرق التي حسنت بها DeepSeek الكفاءة وحصلت على المزيد من عمليات الفاصلة العائمة في الثانية (FLOPS) من وحدات معالجة الرسوميات كانت تدريب V3 محليًا بصيغة الفاصلة العائمة 8 بت (fp8)، بدلاً من صيغة 16 بت أو 32 بت المعتادة. هذه الفكرة ليست جديدة، فالمختبرات الأخرى تفعل ذلك أيضًا، ولكنها كانت مفتاحًا لتحقيق وفورات هائلة في الذاكرة دون التضحية بالأداء.
التعزيز الحاسم هنا هو "تصحيح تراكم fp8" (fp8 accumulation fix) الذي يدمج العمليات الحسابية بشكل دوري مرة أخرى في مجمع (accumulator) عالي الدقة (fp32) لمنع الأخطاء العددية الصغيرة من التراكم. والنتيجة هي تدريب أكثر كفاءة بكثير عبر آلاف وحدات معالجة الرسوميات، مما يقلل التكلفة مع الحفاظ على جودة النموذج.
2. هندسة مزيج الخبراء (Mixture of Experts - MoE)
طريقة أخرى ذكية تستخدمها DeepSeek لتحقيق أقصى استفادة من أجهزتها هي تطبيقها الخاص لهندسة "مزيج الخبراء". يحتوي DeepSeek V3 على 671 مليار معامل (parameter)، ولكن يتم تنشيط 37 مليارًا فقط لتوقع رمز معين. على النقيض من ذلك، فإن أكبر وأكثر نماذج Llama 3 قدرة لا تستخدم هندسة مزيج الخبراء، لذا فإنها تنشط جميع معاملاتها البالغ عددها 405 مليارًا لكل توقع رمز.
بمعنى آخر، ينشط V3 عددًا أقل من المعاملات بمقدار 11 مرة لكل تمريرة أمامية (forward pass)، مما يوفر أطنانًا من الحوسبة. مزيج الخبراء ليس مفهومًا جديدًا، ولكنه كان تحديًا لتدريب النماذج بهذه الهندسة بكفاءة. قدمت DeepSeek تقنيات مبتكرة استقرت الأداء وزادت من استخدام وحدات معالجة الرسوميات.
3. الانتباه الكامن متعدد الرؤوس (Multi-head Latent Attention - MLA)
للتغلب على عنق الزجاجة الرئيسي في الأداء، يستخدم V3 الانتباه الكامن متعدد الرؤوس (MLA)، والذي كشفت عنه DeepSeek لأول مرة في ورقة V2 (مايو 2024). MLA هو حل مصمم لمعالجة قيود تخزين ذاكرة التخزين المؤقت للزوج المفتاح والقيمة (KV cache)، وهو أحد أكبر مصادر الحمل الزائد في النماذج الكبيرة.
بدلاً من تخزين مصفوفات المفاتيح والقيم الكاملة، يقوم MLA بضغطها إلى تمثيل كامن (latent representation)، وإعادة بنائها فقط عند الحاجة. وقد ساعد ذلك نموذج V2 على تقليل حجم ذاكرة التخزين المؤقت KV بنسبة 93.3% وعزز الحد الأقصى لإنتاجية التوليد لديه إلى 5.76 مرة.
4. التنبؤ متعدد الرموز (Multi-token Prediction - MTP)
أخيرًا، على عكس النماذج التقليدية التي تتوقع الرمز التالي فقط، يستخدم V3 التنبؤ متعدد الرموز (MTP). يتيح MTP لنموذج V3 توقع عدة رموز مستقبلية في كل خطوة. هذا يكثف إشارات التدريب، ويوفر المزيد من الملاحظات لكل خطوة لتحسين كفاءة البيانات وتسريع التعلم. كما أنه يحسن تخطيط التمثيل، مما يسمح للنموذج بالتخطيط المسبق للتسلسلات للحصول على مخرجات أكثر سلاسة وتماسكًا أثناء الاستنتاج.
يمكن إعادة استخدام وحدات MTP لفك التشفير التخميني (speculative decoding)، مما يقلل من خطوات المعالجة المتسلسلة ويسرع التوليد بشكل كبير. كل هذه الابتكارات مجتمعة تجعل V3 أحد أكثر النماذج الأساسية إثارة للإعجاب في السوق، وقد كان متاحًا لبعض الوقت الآن.
فن الاستدلال: إنجاز DeepSeek R1
على الرغم من أن V3 كان موجودًا لبعض الوقت، إلا أن الإصدار الأخير لنموذج الاستدلال DeepSeek R1 هو ما أحدث ضجة حقيقية. يمكن تحسين معظم النماذج اللغوية الكبيرة (LLMs) من خلال مطالبتها "بالتفكير خطوة بخطوة"، ولكن ما يميز نماذج الاستدلال هو أنها مُدربة خصيصًا على تقسيم المشكلات الصعبة والتفكير فيها لفقرات طويلة في المرة الواحدة.
في سبتمبر، أظهرت OpenAI قوة هذا النهج الجديد مع نموذج O1، الذي حقق نتائج رائدة في معايير الرياضيات والبرمجة والعلوم. ومع R1، اتبعت DeepSeek نهجًا مشابهًا ونشرت "الوصفة السرية".
التعلم المعزز والابتكار في DeepSeek R1
تحقق OpenAI وDeepSeek نتائجهما المبهرة من خلال التعلم المعزز (Reinforcement Learning - RL)، وهي تقنية لتشكيل سلوك النموذج اللغوي الكبير بناءً على إشارات التغذية الراجعة والمكافأة. تستخدم النماذج اللغوية الكبيرة الحديثة بعض الاختلافات في التعلم المعزز مع الملاحظات البشرية (RLHF) أو التعلم المعزز من الملاحظات الاصطناعية (RLAIF) لتحسين فائدة نماذجها ومواءمتها. ولكن نماذج الاستدلال تطبق RL خصيصًا على مهمة التفكير خطوة بخطوة من خلال المشكلات المعقدة.
فكيف طبقت DeepSeek التعلم المعزز للحصول على نموذج استدلالي؟
- قاموا بتجميع مجموعة من المشكلات ذات المخرجات القابلة للتحقق، خاصة في مسائل الرياضيات والبرمجة.
- صمموا خط أنابيب تدريب لجعل النموذج يفكر قليلاً ثم يخرج الإجابات الصحيحة.
- لم يقدموا للنموذج أي أمثلة خارجية لكيفية التفكير، سواء من البشر أو الذكاء الاصطناعي.
- كانت عملية التقييم بسيطة للغاية: بدلاً من استخدام ذكاء اصطناعي معقد لمنح النموذج ملاحظات دقيقة، استخدمت DeepSeek قواعد بسيطة لتقييم المخرجات النهائية للنموذج بناءً على الدقة والتنسيق.
- استخدموا هذه النتائج لتحديث نموذجهم من خلال تقنية جديدة نشروها في فبراير 2024 تسمى "تحسين السياسة النسبية للمجموعة" (Group Relative Policy Optimization - GRPO).
بشكل مدهش، بهذه العملية وحدها، شهدت DeepSeek ظهور قدرات الاستدلال على مدى آلاف خطوات التعلم المعزز. تعلم النموذج مهارات مثل "سلسلة التفكير الموسعة" (extended Chain of Thought) وحتى مر بلحظة "لحظة الإدراك" (aha moment) حيث أدرك أخطائه وتراجع لتصحيح منطقه. كان هذا النموذج هو R1-0، أحد أول النماذج الكبيرة التي تحقق نتائج عالية المستوى من خلال التعلم المعزز وحده.
من R1-0 إلى R1: تحسين قابلية القراءة
على الرغم من إنجازات R1-0، فإن خطوات تفكيره كانت تعاني من ضعف في قابلية القراءة، حيث كان يتنقل بين الإنجليزية والصينية بشكل عشوائي. ولحل هذه المشكلة، قدمت DeepSeek "مرحلة البدء البارد" (cold start phase) التي تتضمن ضبطًا دقيقًا (fine-tuning) على أمثلة استدلالية منظمة قبل تطبيق التعلم المعزز للحصول على R1 النهائي. أدى ذلك إلى القضاء على مشكلات خلط اللغات وجعل المخرجات أكثر قابلية للفهم. النتائج مثيرة للإعجاب: يحقق R1 أداءً يضاهي O1 في بعض معايير الرياضيات والبرمجة.
التأثير الأوسع ومشهد الصناعة
إذا لم يكن R1 قد ظهر من العدم، فما الذي يفسر دورة الضجيج هذه؟
1. إمكانية الوصول والتكلفة المنخفضة
أحد التفسيرات هو سهولة الوصول الهائلة إلى نموذج DeepSeek. R1 متاح مجانًا من خلال موقعهم الإلكتروني وتطبيقهم، وهو مجاني للتنزيل والتشغيل محليًا والتخصيص. وبفضل جميع تحسينات الكفاءة، فإنه يوفر أداءً قريبًا من أحدث ما توصلت إليه التقنيات بجزء بسيط من سعر نماذج الاستدلال الأخرى.
2. تصحيح المفاهيم الخاطئة حول التكلفة
تفسير آخر هو أن الكثير من الضجيج لم يكن له علاقة بالتحسينات الخوارزمية المحددة التي وصفناها، بل بالمفاهيم الخاطئة حول تكلفة تدريب V3 المزعومة البالغة 5.5 مليون دولار. هناك تفاصيل مهمة هنا: يشير الرقم البالغ 5.5 مليون دولار فقط إلى تكلفة التشغيل التدريبي النهائي لـ V3. لا يشمل ذلك أي من تكاليف تدريب R1 أو البحث والتطوير المرتبطة به أو نفقات تشغيل الأجهزة، والتي يُفترض أنها بمئات الملايين بالنظر إلى التحسينات الخوارزمية المتطرفة هنا. يبدو رقم التشغيل التدريبي البالغ 5.5 مليون دولار ممكنًا تمامًا، وتجدر الإشارة إلى أن هذا العمل قابل للاستنساخ؛ فقد طبق مختبر في جامعة كاليفورنيا في بيركلي مؤخرًا التقنيات الرئيسية لـ R1-0 لإنتاج استدلال معقد في نموذج أصغر مقابل 30 دولارًا فقط.
3. فتح الأفق للاعبين الجدد
ما أثبتته DeepSeek حقًا هو أنه لا يزال هناك مجال للاعبين الجدد في هذا المجال. على وجه الخصوص، هناك مجال لإعادة بناء المجموعة التقنية (stack) لتحسين أعباء عمل وحدات معالجة الرسوميات، وتحسين البرامج في طبقة الاستنتاج، وأدوات التطوير، وتطوير النوى التي يولدها الذكاء الاصطناعي. في نهاية المطاف، هذه أخبار رائعة لتطبيقات الذكاء الاصطناعي في قطاعات المستهلكين أو الشركات، حيث يعني ذلك أن تكلفة الذكاء تستمر في الانخفاض.
الخلاصة: مستقبل الذكاء الاصطناعي بين أيدينا
في الختام، يُعد ظهور DeepSeek R1 وV3 علامة فارقة في رحلة تطور الذكاء الاصطناعي. لقد أظهرت DeepSeek قدرة مذهلة على الابتكار تحت القيود، مقدمة نماذج مفتوحة المصدر عالية الأداء بكفاءة غير مسبوقة. هذا لا يعزز المنافسة فحسب، بل يسرع أيضًا من وتيرة الابتكار في الصناعة بأكملها.
الفائدة الكبرى هنا هي أن تكلفة "الذكاء" أصبحت في متناول اليد أكثر فأكثر، مما يفتح أبوابًا لا حصر لها للتطبيقات الجديدة وريادة الأعمال. إذا كنت تفكر في بناء شركة ناشئة في مجال الذكاء الاصطناعي، فإن هذا هو أفضل وقت ممكن للانطلاق. المستقبل مشرق وواعد، والابتكار يتسارع، ومن يدري، ربما تكون فكرتك القادمة هي التي ستحدث الضجة الكبرى!
ترقبوا المزيد من المقالات حول أحدث التطورات في عالم الذكاء الاصطناعي!
اترك تعليقك