لماذا يُعدّ نقص الشرائح الأرخص على نحو متزايد مع ارتفاع الطلب على الأجهزة؟ مع زيادة الكفاءة بشكل كبير يتصاعد احتياج العتاد

لن يؤدي خفض سعر Kimi K3 إلى تقليل الطلب على الرقائق؛ بل قد يؤدي في الواقع إلى رفع إجمالي استهلاك العتاد بشكل أكبر.
(ملخص سابق: هل توجد عتبة تشغيل محلية لـ Kimi K3؟ ابدأ بـ 64 بطاقة GPU، استهلاك كهرباء 45kW، وخرج اللاعبون من خيار البناء بأنفسهم)
(إضافة سياقية: من زاوية حجم التداول، تصل إلى 100 مليار دولار! يُقال إن Anthropic تعتزم استئجار موارد حوسبة من Meta للتخفيف من أزمة نقص GPU)

فهرس المقال

Toggle

  • ظهور Kimi K3: قفزة في الكفاءة تعكس الطلب على العتاد
  • مفارقة جينسن: سعر أقل يشعل استهلاك token أكثر
  • ارتفاع KV Cache: سياقات طويلة تلتهم الذاكرة
  • منافسة تتجمد: عمالقة الذكاء الاصطناعي الأميركيون يواصلون ضخ المزيد
  • شراء جماعي بالمصدر المفتوح: بيانات OpenRouter تظهر نمواً
  • الخلاصة: Kimi K3 محفز لقطاع العتاد

أعاد Kimi K3 المستثمرين في استثمارات الذكاء الاصطناعي إلى سؤال محوري: إذا كان النموذج أرخص وأكثر كفاءة، فهل يعني ذلك انخفاضًا في احتياجات الرقائق والذاكرة؟ إجابة كلٍّ من سيتي آند بنك أوف أميركا للأوراق المالية تميل إلى النفي؛ فرفع الكفاءة قد يطلق استخدامًا أكبر، ومن ثم يرفع استهلاك الموارد الإجمالي.

وفقًا لمنصة تتبع الصفقات، فإن Kimi K3 الصادرة عن شركة Moonshot تتمتع بـ 2.8 تريليون معامل، وتستهدف نافذة سياق حتى 100 مليون token، بالإضافة إلى مهام وكلاء ذوي دورات طويلة. يرى محلل سيتي للأشباه المولدة Peter Lee أنه حتى لو أصبح Kimi K3 مستخدمًا على نطاق واسع، فإن احتياجات الذاكرة العامة مثل خوادم DDR5 و eSSD ستواصل الارتفاع.

كما ذكر Vivek Arya، محلل بنك أوف أميركا للأوراق المالية، في بحث بتاريخ 17 يوليو، أن مختبرات الذكاء الاصطناعي الأميركية المتقدمة من الأرجح تزيد استثماراتها في القدرة الحوسبية بدلًا من خفضها. وإذا استمر اقتراب النماذج مفتوحة المصدر في الصين، فسيحتاج كل من OpenAI وAnthropic وGoogle وغيرها من الروّاد إلى أحجام تدريب أكبر، والتركيز على الاستدلال بشكل أعمق وتحديثات أسرع للمنتجات للحفاظ على التمايز.

وهذا يعني أن منطق تسعير Kimi K3 في السوق لا ينبغي أن يقتصر على انخفاض تكلفة الاستدلال المفرد. الأهم هو ما إذا كان النموذج منخفض السعر يؤدي إلى عدد أكبر من الاستدعاءات، وسلاسل مهام أطول، وتوليد token أكثر. إذا كانت الإجابة نعم، فستستفيد أيضًا GPU وHBM وDDR5 و eSSD والاتصال عالي السرعة وأنظمة الاستدلال.

ظهور Kimi K3: قفزة في الكفاءة تعكس الطلب على العتاد

تنظر سيتي إلى Kimi K3 بوصفه حالة محتملة من "مفارقة جينسن" داخل سلسلة صناعة الذكاء الاصطناعي. جوهر هذه المفارقة هو أنه بعد خفض تكلفة الاستخدام للوحدة نتيجة تحسين الكفاءة التقنية، قد يرتفع حجم الاستخدام بدرجة كبيرة، لتتحول في النهاية إلى عدم انخفاض إجمالي استهلاك الموارد بل زيادته.

وتستمد جاذبية Kimi K3 من مزيج السعر المنخفض والأداء المرتفع. وتُظهر الأسعار المعلنة أن سعر الإدخال عند نسبة نجاح الكاش (cache hit) يبلغ 0.3 دولار لكل مليون token، بينما سعر الإخراج 15 دولارًا لكل مليون token. ويُفصح عن خطة الأوزان الكاملة في 27 يوليو، والهدف هو دعم أعمال الوكلاء ذوي الفترات الطويلة.

وترى سيتي أن خفض سعر النموذج لن يؤدي تلقائيًا إلى تقليل الطلب على العتاد. على العكس من ذلك، قد يزيد انخفاض التكلفة من رغبة المطورين والشركات في استدعاء النموذج، ما يدفع إلى نشر وكلاء ذكاء اصطناعي أكثر. فمهمات الوكلاء ليست مجرد أسئلة وأجوبة لمرة واحدة؛ بل تولّد باستمرار ضمن مهام متتابعة، مع قراءة ومعالجة token. مع زيادة عدد الاستدعاءات وطول المهام، تعود إعادة تحويل انخفاض التكلفة إلى إجمالي استهلاك موارد أكبر.

لذلك، فإن تأثير Kimi K3 على سلسلة أشباه المولّدات لا يتمحور حول "هل الاستدعاء الواحد أرخص؟"، بل حول "هل إجمالي كمية token يتوسع؟". وهذا بالضبط هو سبب ترجيح سيتي لطلب خوادم DDR5 و eSSD.

مفارقة جينسن: سعر أقل يشعل استهلاك token أكثر

يعتمد Kimi K3 على ثلاث تقنيات رئيسية: Kimi Delta Attention وAttention Residuals وStable LatentMoE. تُستخدم Kimi Delta Attention لخفض تكلفة نافذة سياق 1 مليون token؛ وتُستخدم Attention Residuals لاختيار جداول تمثيلات بشكل انتقائي بين أعماق مختلفة داخل النموذج؛ بينما يرفع Stable LatentMoE مستوى التفرّع (sparsification)، إذ لا يتم تفعيل سوى 16 خبيرًا من بين 896 لكل token.

وتشير البيانات التقنية لدى Moonshot إلى أن هذه البنية ترفع كفاءة التوسّع لـ Kimi K3 إلى 2.5 ضعف كفاءة K2. وتُعدّ نسبة التفرّغ العالية وقدرة السياق الطويل أساسًا رئيسيًا لخفض تكلفة التنفيذ.

لكن سيتي تؤكد أن هذا لا يعني اختفاء ضغط موارد جهة الاستدلال. ما يزال Kimi K3 غير حل خفيف النشر؛ إذ يتطلب تنفيذُه عنقودًا متعدد العقد، وتكوين عقد فائقة يتضمن أكثر من 64 وحدة GPU. والأهم أن السياق الطويل ومهام الوكلاء سترفع احتلال KV Cache، ما يزيد عبء الذاكرة في جهة الاستدلال.

ويرتبط طلب KV Cache مباشرةً بـ DDR5 في الخوادم و eSSD. يتحمل DDR5 مسؤولية الوصول إلى البيانات عالي التردد، بينما يستفيد eSSD من احتياجات أكبر للذاكرة المؤقتة وتخزين البيانات. وبالنسبة لمصنّعي الذاكرة، فإن المتغير الحاسم ليس ما إذا كان نموذج بعينه أكثر توفيرًا في حسابات المعالجة؛ بل كم مرة سيتم استدعاء النموذج بعد خفض السعر، وكم token يتم توليدها في كل استدعاء، وكم يطول مسار مهام الوكلاء.

ارتفاع KV Cache: سياقات طويلة تلتهم الذاكرة

تتوافق الخلاصة لدى بنك أوف أميركا مع سيتي، لكن تركيزها يميل أكثر إلى GPU والبنية التحتية للذكاء الاصطناعي. يرى Vivek Arya أن النماذج مفتوحة المصدر الصينية الأقوى قد لا تؤدي بالضرورة إلى تقليل عمالقة الذكاء الاصطناعي الأميركيين لاستثماراتهم في القدرة الحوسبية. بل إن تضييق فجوة النموذج قد يرفع تكلفة استمرار الروّاد في الحفاظ على مزاياهم.

ويقول بنك أوف أميركا إن استمرار اقتراب النماذج مفتوحة المصدر سيجبر OpenAI وAnthropic وGoogle على الاعتماد على أحجام تدريب أكبر، ودورات تعزيز التعلم ومصادر بيانات تركيبية أكثر، واستدلال أثناء الاختبار أعمق، وإيقاع أسرع لإطلاق المنتجات للحفاظ على التمايز.

لا تعتمد هذه الحجة على أي نموذج يتصدر على المدى القصير. قد تتبدل قوائم الترتيب للنماذج الكبيرة بسرعة، لكن ما تشتريه الشركات فعليًا هو مخرجات ذكاء اصطناعي مستقرة، ومنخفضة التأخير، وعالية الإتاحة، وبكلفة أقل لـ "الإنتاج الفعّال لكل وحدة". وحين تتقارب قدرات النماذج، تنتقل ضغوط المنافسة إلى البنية التحتية الأساسية، بما في ذلك GPU وHBM والاتصال عالي السرعة وأنظمة الاستدلال.

لذلك ترى بنك أوف أميركا أن ظهور نماذج مثل Kimi K3 لا ينبغي فهمه ببساطة على أنه "النموذج أكثر كفاءة، والرقائق أقل". والواقع الأكثر شيوعًا هو أن المنافسة بين النماذج ستشتد، وسيواصل الروّاد زيادة ضخ القدرة الحوسبية للحفاظ على الفارق.

المنافسة تتجمد: عمالقة الذكاء الاصطناعي الأميركيون يواصلون ضخ المزيد

يعتمد Kimi K3 بنية MoE، ما يعني إمكانية فصل العدد الإجمالي للمعاملات عن المعاملات الفعلية التي يتم تفعيلها في كل عملية استدلال. تقلل هذه التغييرات بعض ضغط الحوسبة، لكنها تحول عنق الزجاجة في البنية التحتية من مجرد القدرة الحوسبية إلى وصول الذاكرة المخصصة للفيديو (VRAM)، وتوجيه الخبراء (expert routing)، وزمن استجابة الاستعلام، وقدرات الاتصال البيني.

وتؤكد بنك أوف أميركا أن استدلال MoE يتطلب نقل البيانات بكفاءة أعلى، وجدولة لوحدات الخبراء، وربط عنقود حوسبي أكبر. وقد اقترحت Nvidia أن الاستدلال بـ MoE الحديث يتطلب نطاقًا أكبر من وحدات GPU. وتُظهر حساباتها أن GB300 NVL72 من حيث كفاءة الأداء لكل واط على النماذج مفتوحة المصدر الرائدة قد يصل إلى 25 مرة مقارنة بمنصة Hopper.

كما توضح CoreWeave اختبارات حول Kimi K2.6 أن نماذج MoE مفتوحة المصدر، حتى إذا كانت تفعّل جزءًا فقط من المعاملات في كل مرة، فلابد من المرور ببنية Nvidia الأساسية المُحسّنة مثل GB300/GB200 NVL72 للحفاظ على السبق في السرعة وكفاءة التكلفة.

وهذا يعني أنه قد تتجه أوزان النماذج تدريجيًا نحو الطابع السلعي (commodity)، لكن قيمة وحدات GPU المطلوبة لتنفيذ النماذج، والذاكرة عالية النطاق الترددي، والاتصال الشبكي البيني، وأنظمة الاستدلال لن تختفي. بل مع توسع حجم استدعاءات النماذج، قد تصبح هذه الجوانب أماكن أكثر تركيزًا للمنافسة.

شراء جماعي بالمصدر المفتوح: بيانات OpenRouter تظهر نمواً

تستشهد بنك أوف أميركا أيضًا ببيانات OpenRouter لتوضح أن حجم استدعاء النماذج لا يزال يرتفع بسرعة. وبوصف OpenRouter منصة API طرف ثالث تربط عدة مختبرات نماذج، فإن استخدام token على المنصة ينمو باستمرار، حيث تجاوزت كمية token لموديلات مختبرات الذكاء الاصطناعي في الصين بالفعل تلك الخاصة بمختبرات ليست في الصين.

لا يمكن لهذه البيانات أن تمثل مباشرةً كل سيناريوهات الشركات والمستهلكين، لكنها تشير على الأقل إلى أن خيارات المطورين داخل نظام النماذج المفتوحة تتغير. قد يؤدي انخفاض أسعار النماذج وتحسن قدراتها إلى دفع حجم الاستدعاءات لمواصلة التوسع، بدلًا من أن تعوض كفاءة نموذج واحد فقط هذا التوسع.

كما يرتفع الاستخدام المدفوع من الشركات. تُظهر بيانات Ramp أنه حتى يونيو 2026، اشترك قرابة 55% من الشركات الأميركية بشكل مدفوع في نماذج ذكاء اصطناعي، منصات أو أدوات، وهو أعلى من تقدير 21% في مسح BTOS لمكتب إحصاء السكان الأميركي وفقًا للتعداد. وبحسب النموذج، تبلغ نسبة اعتماد الشركات لدى Anthropic 42.4%، وOpenAI 39.5%.

الخلاصة: Kimi K3 محفز لقطاع العتاد

لكن تظل نفقات الذكاء الاصطناعي شديدة التركّز. تستخدم شريحة الـ 1% الأولى من المستخدمين المؤسسين متوسط 4,833 دولارًا شهريًا لكل موظف على الإنفاق بالذكاء الاصطناعي، بينما تبلغ لدى الـ 10% الأوائل 516 دولارًا، ولا يتجاوز الوسيط العام 11 دولارًا فقط. تصل نسبة الاشتراكات في قطاع التكنولوجيا والإعلام إلى 79.8%، وتبلغ نسبة اعتماد الشركات الكبيرة 65.5%، وهي أعلى من الشركات المتوسطة عند 61.3% والشركات الصغيرة عند 48.7%.

تدعم هذه المجموعة من البيانات استنتاجًا: ما يزال استخدام الذكاء الاصطناعي في مرحلة الانتشار. فإذا أدى نموذج منخفض السعر إلى خفض عتبة الدخول، فقد تأتي الطلبات الإضافية مستقبلاً من مزيد من الشركات، ومزيد من المطورين، ومزيد من تطبيقات الوكلاء.

والخلاصة المشتركة لدى كلٍّ من سيتي وبنك أوف أميركا للأوراق المالية هي أن معنى Kimi K3 لا يكمن في ما إذا كان نموذج بعينه يخفض تكلفة الاستدلال للوحدة؛ بل في ما إذا كان انخفاض التكلفة يحرر أحمال عمل أكبر على نطاق أوسع.

بالنسبة لسيتي، فإن الاتجاه الأكثر استفادة مباشرة هو خوادم DDR5 و eSSD. فالسياقات الطويلة وKV Cache ومهام الوكلاء ترفع احتياجات الوصول إلى الذاكرة والتخزين. وبالنسبة لبنك أوف أميركا، فإن الأهم يتمثل في GPU وHBM والاتصال عالي السرعة وأنظمة الاستدلال، لأن المنافسة بين النماذج ستجبر الروّاد على مواصلة الاستثمار في البنية التحتية.

كما أشارت بنك أوف أميركا إلى أن ما يتعلق بـ Kimi K3 مثل "EDA مفتوح المصدر بدقة 45 نانومتر" لا ينبغي تفسيره ببساطة على أنه استبدال لـ EDA التجاري. بل يشير ذلك إلى أن تصميم الرقائق ما يزال يعتمد على أدوات EDA. وفي عمليات التصنيع المتقدمة، تظل شركات EDA التجارية مثل Cadence وSynopsys في مواقع محورية.

تتمثل المخاطرة في سيناريو آخر: إذا حدث ضغط على نماذج الذكاء الاصطناعي، وتقدم تحسين الاستدلال وكفاءة العتاد على المدى الطويل أسرع من نمو أحمال العمل الجديدة، فقد تتراجع وتيرة توسع البنية التحتية للذكاء الاصطناعي بشكل مرحلي. لكن في إطار طرح الشركتين الاستثماريتين المذكورتين، يبدو أن Kimi K3 أكثر شبيهًا بمحفز يدفع الاستخدام للأعلى، وليس إشارة إلى تقويض الطلب على الرقائق. وبعد تحسن الكفاءة، يجب أن يركز السوق بدلًا من ذلك على المزيد من token، والمزيد من الاستدلال، والمزيد من استهلاك العتاد الأساسي.

META%0.02-
C%0.46-
CRWV%0.23-
RAMP%0.52-
SNPS%1.54-
شاهد النسخة الأصلية
قد تحتوي هذه الصفحة على محتوى من جهات خارجية، يتم تقديمه لأغراض إعلامية فقط (وليس كإقرارات/ضمانات)، ولا ينبغي اعتباره موافقة على آرائه من قبل Gate، ولا بمثابة نصيحة مالية أو مهنية. انظر إلى إخلاء المسؤولية للحصول على التفاصيل.
  • أعجبني
  • تعليق
  • إعادة النشر
  • مشاركة
تعليق
إضافة تعليق
إضافة تعليق
لا توجد تعليقات
  • مُثبت