مقابلات

كين كلافي، الرئيس التنفيذي لشركة VDURA – سلسلة المقابلات: محادثة العودة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

كين كلافي، الرئيس التنفيذي والرئيس في شركة VDURA، هو قائد أعمال ومنتجات ذو خبرة عميقة في السحابة والبنية التحتية للشركات وتطوير البرمجيات والأجهزة وتحقيق النمو الاستراتيجي عبر المنتجات والعمليات والوظائف التسويقية. خلال مسيرته المهنية، بنى وقيادة فرق عالمية عالية الأداء، نفذ الاستراتيجية الشركة، وحقق نموًا ربحياً في الإيرادات وابتكار المنتجات، وتحول الأعمال التي لا تؤدي جيدًا. قبل توليه منصب الرئيس التنفيذي في VDURA، شغل كلافي مناصب قيادية في شركة Seagate Technology (STX ) ، حيث شغل منصب نائب الرئيس والمدیر العام المسؤول عن الأنظمة المؤسسية والهامش، ومناصب قيادية سابقة في Xyratex و Adaptec و Eurologic، مما أضفى عليه عقودًا من الخبرة في تخزين الشركات والحواسيب عالية الأداء.

VDURA هي شركة بنية تحتية بيانات محددة بالبرمجيات تبني حلول تخزين حديثة مُختصة بالذكاء الاصطناعي والحواسيب عالية الأداء تحت شعار “السرعة تلاقي المتانة”. منصة بيانات VDURA الرئيسية تجمع بين أداء نظام الملفات الموازي الأول مع متانة تخزين الكائنات في هيكل موحد يمتد خطيًا عبر آلاف العملاء والعناصر بينما يبسط العمليات ويقلل من التكلفة الإجمالية للملكية. تأسست في الأصل باسم Panasas واعيد تسميتها في عام 2024، تدعم منصة VDURA البيئات المحلية والسحابية والهجينة مع تutomatisation متقدمة وتسريع البيانات الوصفية وأداء قابل للتطوير مصمم لاستمرار تغذية مجموعات GPU وحماية البيانات لاستخدامات الذكاء الاصطناعي والحواسيب عالية الأداء للمؤسسات والبحوث والحالات الحساسة.

كيف شكلت رحلتك عبر الحواسيب عالية الأداء وتخزين الشركات رؤيتك أن التخزين يصبح العائق المحدد في بنية تحتية الذكاء الاصطناعي؟

بناءً على خبرتي في بناء أنظمة تخزين لبيئات الحواسيب الأكثر طلبًا، طوروا直ورة عن أين تعيش العوائق الفعلية مقابل حيث يفترض الناس أنها تعيش. في Xyratex ومن خلال عمل ClusterStor في Seagate، كنا نحل مشاكل التخزين للحواسيب الفائقة حيث كانت الفيزياء قاسية. إما تغذي الحوسبة أو لا.

ما أراه الآن في بنية تحتية الذكاء الاصطناعي هو نفس العائق الأساسي، لكن باقتصاد مختلف. كان هوس GPU في سوق Neocloud مبررًا. أنشأت NVIDIA (NVDA ) موردًا نادرًا ومتحولًا. لكن افتراض أن التخزين سيتوسع جنبًا إلى جنب معه بسهولة وبتكلفة منخفضة كان دائمًا سيُكسر. لقد انكسر. التخزين ي趨 حاليًا نحو 20 إلى 30 في المائة من ميزانيات بنية تحتية الذكاء الاصطناعي في جميع التثبيتات الفلاشية، وينمو أسرع من أي مكون آخر. عندما قمت بإنفاق مسيرتك المهنية في مشاهدة التخزين يصبح العائق المحدد في كل بيئة حوسبة كبيرة، تتوقف عن الاندهاش عندما يلحق بهم سوق الآخر.

لماذا تم التقليل من أهمية تخطيط التخزين خلال الاستيلاء على بنية تحتية Neocloud؟

تلاشت افتراضات هيكلية في اللحظة الخاطئة. أولًا، كانت أسعار الفلاش مؤقتة ومواتية. كانت وحدات SSD من نوع NVMe متاحة وبأسعار معقولة بدرجة كافية لجعل جميع التثبيتات الفلاشية تبدو معقولة. لم يكن هذا حكمة معمارية، بل نتاج نافذة اقتصادية قصيرة الأجل التي اعتقد المشغلون أنها حالة دائمة.

ثانيًا، مكافأة الديناميكية التنافسية أعداد GPUs فوق كل شيء آخر. كان سوق Neocloud يُقيم على عدد شريحة NVIDIA التي يمكنك تركيبها. التخزين كان حوالي 10 في المائة من بند في القائمة، سهل المرور من خلال الشراء بدون فحص دقيق. ثالثًا، كان قرار جميع التثبيتات الفلاشية يبدو آمنًا لأنها قامت بإزالة التعقيد. طبقة واحدة، نوع وسائط واحد، بسيط للشراء وتشغيله. المشكلة هي أن “بسيط” و”مستدام اقتصاديًا” توقفت عن كونهما نفس الشيء في اللحظة التي تصلبت فيها توريدات NAND وارتفعت الأسعار. في ذلك الوقت، كانت قرارات البنية التحتية已经 محسومة.

ما الذي يدهش مشغلي البنية التحتية أكثر عندما يرون كيف يؤثر التخزين على استخدام GPU؟

العلاقة أكثر مباشرة مما يدركه معظم المشغلين حتى يروا GPUs في حالة غير نشطة. تشغيل التدريب مع نقاط تحقق متكررة يخلق طلبات كتابة متكررة يمكن أن يوقف الحوسبة إذا لم يكن слой التخزين قادرًا على امتصاصها بسرعة كافية. أنابيب البيانات لما قبل المعالجة والاستهلاك تخلق متطلبات إنتاج قراءة مستمرة، والتي، إذا لم تُ满، ستجوع GPUs من العمل.

توجيه NVIDIA الخاص بDGX يقيّم ذلك: التدريب النصي لLLM يتطلب حوالي 0.5 جيجابايت / ثانية من إنتاج القراءة لكل GPU، في حين أن عملاء الذكاء الاصطناعي والترميز يتطلبون حوالي 4 جيجابايت / ثانية من القراءة و 2 جيجابايت / ثانية من الكتابة لكل GPU. إذا لم يكن هيكل التخزين الخاص بك قادرًا على تقديم ذلك، فأنت لا تشغل GPUs بكامل طاقتها. أنت تشغلها بجزء من التخزين.

الهيكل المعماري يهم بشكل كبير في مستوى المجموعة. نظام تخزين يضع وسيطًا بين القرص والعميل قد يظهر إنتاجًا مماثلًا في قراءة واحدة، لكن في النطاق يمكنك أن تنتهي بضرورة ثلاثة أضعاف عدد الأقراص لتسريع نفس أسطول GPU. ثلاثة أضعاف الأقراص الصلبة، ثلاثة أضعاف الطاقة، ثلاثة أضعاف مساحة الراك. ریاضیات الاستخدام تتراكم بسرعة.

ما هي الفروق التكلفة التي يمكن أن تظهر فقط من اختيار SSD والتصميم المعماري حتى وإن كانت معايير الإنتاج المماثلة تبدو متشابهة؟

هذا هو المكان الذي يتعرض المشغلون للخطر الجدي، لأن الأرقام الرئيسية يمكن أن تكون خادعة حقًا. خذ مثالًا ممثلًا. تكلفة قرص SSD من نوع QLC NVMe بسعة 122.88 تيرا بايت تبلغ حوالي 27,000 دولار. يُقدم قرص من نفس الجيل بسعة 7.68 تيرا بايت إنتاجًا متساويًا لقراءة متتالية مقابل حوالي 1,800 دولار. لمجموعة 4,096 GPU على مواصفات NVIDIA المُحسنة، ينتج عن هذا القرار وحده في اختيار السعة فاتورة فلاش تتراوح بين 600,000 دولار و 9.6 مليون دولار. الإنتاج متشابه. الفرق الوحيد هو كمية البيانات الباردة التي تختار وضعها على وسائط فلاشية متميزة لا توفر أي فائدة إضافية في الأداء.

علاوة على ذلك، يحدد التصميم المعماري عدد الأقراص في نطاق المجموعة. هيكل يُقدم حوالي 5.8 جيجابايت / ثانية من الإنتاج المقاس للقراءة لكل قرص SSD يحتاج إلى حوالي 353 قرصًا لتسريع مجموعة 4,096 GPU. هيكل يُقدم حوالي 1.9 جيجابايت / ثانية لكل قرص SSD، بسبب الحمل الإضافي للوسيط، يحتاج إلى أكثر من 1,000. عند 12,000 دولار لكل قرص 30 تيرا بايت، هذا الفرق ليس خطأً دقيقًا – إنه سؤال نموذج أعمال.

كيف يجب على المشغلين إعادة التفكير في التخزين الفلاشي مقابل التخزين المتدرج مع ارتفاع أسعار الفلاش وتصلب توريدات NAND؟

النقطة التي يجب البدء منها هي قبول أن الافتراض الاقتصادي وراء البنية التحتية الفلاشية للذكاء الاصطناعي كان دائمًا مشروطًا، وليس أساسيًا. وصف الرئيس التنفيذي لشركة Phison أن قدرة إنتاج NAND تم تخصيصها فعليًا حتى عام 2026. يتوقع Goldman Sachs (GS ) أن ترتفع أسعار DRAM بنسبة عشرات في المائة كل ربع سنوي خلال نفس الفترة. كان الافتراض الافتراضي للبنية التحتية الفلاشية مبررًا عندما كانت الفلاش رخيصة ووفرة. لم يعد كذلك.

الإطار الصحيح هو أن نسأل ما هي الفلاشية في الواقع. الفلاش هو وسط أداء. يجب أن يتم تحديده لتحقيق متطلبات الإنتاج للGPU، لا أكثر. كل شيء آخر، بما في ذلك البيانات الباردة وpoints تحقق التي لا يتم قراءتها بشكل نشط ومجموعات التدريب المأرشفة، ينتمي إلى أقراص HDD عالية الكثافة، التي لا تزال أقل تكلفة بمئات المرات لكل تيرا بايت.

الفخ الذي يقع فيه المشغلون هو معاملة التدرج كإضافة: شراء طبقة فلاشية أولية، وإضافة مخزن كائنات منفصل للبيانات الباردة، وربطهما بمُحوِّلات بيانات خارجية. هذا يُقدم طبقة برمجية ثانية، وطائرة بيانات ثانية، وتركيب شبكة، وعمليات复杂ة. نهج Hyperscaler، الذي يُشغل SSD وHDD داخل نفس طبقة البرمجيات مع تدرج أداء عالي وأي مُحوِّلات بيانات خارجية، يبقي التخزين أقرب إلى 10 في المائة من ميزانية البنية التحتية بينما لا يزال يُشبع كل GPU.

ما هي الدروس التي يمكن أن يتعلمها مشغلو Neocloud من خيارات تصميم تخزين Hyperscaler؟

أهم درس هو أن Google (GOOGL ) و Meta و Microsoft (MSFT ) لا يديرون جميع التثبيتات الفلاشية، وهم لديهم أكثر خبرة في عمل الحملات الذكية من أي شخص. يُشغلون هياكل متدرجة مع تدرج ذكي: فلاش NVMe كافٍ لتحقيق إنتاج GPU، ثم تصريف إلى أقراص HDD عالية الكثافة بأسرع ما يسمح به الفيزياء. هذا ليس تفضيلًا فلسفيًا. إنه أمر اقتصادي مطبق بفهم واضح لفيزياء حمل الذكاء الاصطناعي.

الدرس الثاني هو التكامل المعماري. لا يُحل مشغلو Hyperscaler التدرج bằng ربط أنظمة منفصلة. يُشغلون SSD وHDD على نفس طبقة البرمجيات، نفس طائرة البيانات، مع التدرج كعملية من الدرجة الأولى داخل نظام التخزين، وليس كعملية دفع يُدار بواسطة أداة منفصلة. هذا التكامل هو ما يسمح لهم بالحفاظ على التخزين الاقتصادي في نطاق هائل بينما يحافظون على ضمانات الأداء التي يتطلبها أساطيل GPU.

الدرس الثالث هو ضمان المتانة. يوفر AWS S3 11 ناين من المتانة. يوفر Azure Blob 12 ناين أو أكثر. يمكن أن تقع هياكل تخزين HPC التقليدية المبنية على RAID المحلي دون 5 ناينات في النطاق اعتمادًا على معدلات فشل الأقراص ونافذة إعادة البناء، مما قد يؤدي إلى فقدان آلاف الملفات سنويًا عبر مجموعة من مليار ملف. يمكن أن يُجاوز الترميز التحريري المتعدد المستويات 11 ناين. الفجوة بين هاتين الحقيقتين هي الفرق بين نظام تخزين يمكنك ضمانه بالفعل وآخر لا يمكنك.

كيف يجب على فرق البنية التحتية تحديد التأثير الاقتصادي لتوافر التخزين على أساطيل GPU؟

الرياضيات مخيبة للآمال عندما تُجرى بصدق. فشل التخزين المشترك لا ينتج عن نقص في الالتزام بالخدمة المقدمة بنسبة متساوية. إنه يُنتج خرقًا متزامنًا لجميع أرفف GPU المتصلة بتخزين ذلك. مجموعة 5,000 GPU ذات توافر تخزين 98 في المائة لا توفر فشلًا في الأداء بنسبة 2 في المائة. إنه يُنتج 876,000 ساعة حوسبة غير نشطة سنويًا. عند تكاليف GPU الساعة الممثلة، هذا يُترجم إلى ملايين الدولارات في الحوسبة غير نشطة سنويًا، بالإضافة إلى أرصدة الالتزام بالخدمة المقدمة على كل رف متأثر على التوالي.

نطاق الانفجار لفشل التخزين في مجموعة كبيرة هو المجموعة بأكملها. تحتاج فرق البنية التحتية إلى نمذجة هذا بشكل صريح: ما هو التكلفة السنوية للحوسبة غير نشطة عند رقم توافر التخزين الحالي، ما هي التزامات أرصدة الالتزام بالخدمة المقدمة التي تُرفق بكل مستوى توافر، وما هو خطر انهيار العملاء الناتج عن فشل الالتزام بالخدمة المقدمة؟已经 تقدم CoreWeave (CRWV ) و Oracle (ORCL ) وقت تشغيل الراك بنسبة 99 في المائة. المُزوِّدون الذين لا يستطيعون مطابقة ذلك يفقدون الصفقات اليوم، والصفقات التي يفقدونها هي العقود التجارية الكبيرة القيمة التي يحتاج سوق Neocloud إلى إثبات اقتصادياته على المدي الطويل.

كيف تُقارن هياكل التخزين المختلفة في الأداء لكل واط في بيئات مقيدة بالطاقة؟

يظهر هذا في几乎 كل محادثة بنية تحتية جادة الآن، والفرق ليس هامشيًا. إنه فرق متكامل. بناءً على المواصفات المنشورة والتهيئة المماثلة، لتسليم حوالي 1,340 جيجابايت / ثانية من إنتاج القراءة، يُحقق هيكل واحد 55 كيلو واط بينما يُحقق هيكل آخر نفس الإخراج عند حوالي 16 كيلو واط. هذا فرق 3.4 مرات في الأداء لكل واط. في مركز بيانات حيث تستهلك حملات الذكاء الاصطناعي 40 إلى 250 كيلو واط لكل رف مقابل اتصال شبكة محدد، فإن واطات التخزين المُهدرة هي GPUs لا يمكنك نشرها. وثائق BlueField-4 من NVIDIA تنص صراحة على أن توافر الطاقة هو العائق الرئيسي لتوسيع مصانع الذكاء الاصطناعي.

هناك أيضًا تأثير ثانوي نادرًا ما يُحسبه المشغلون. بعض هياكل التخزين تتطلب 5 جيجابايت من ذاكرة الوصول العشوائي و 1 إلى 4 نواة CPU مخصصة بشكل دائم لكل عقدة GPU فقط لتحقيق أداء تخزين أقصى. عبر مجموعة 500 عقدة، هذا 2.5 تيرا بايت من ذاكرة الوصول العشوائي وصولًا إلى 2,000 نواة CPU غير متاحة لحملات الذكاء الاصطناعي. كل نواة مسروقة وكل جيجابايت مقفلة هي ضريبة مباشرة على استثمار الحوسبة الذي يُفترض أنه نقطة البداية للبنية التحتية.

كيف يؤثر هيكل التخزين مباشرة على تنافسية الالتزام بالخدمة المقدمة مع ضمانات وقت التشغيل التي ت接近 99 في المائة؟

التخزين هو أكبر نطاق انفجار في أي مجموعة GPU، مما يجعله المتغير الأكثر أهمية في أي التزام بالخدمة المقدمة صادق. نظام التصنيف ClusterMAX 2.0 من SemiAnalysis، الذي يصبح معيارًا مؤثرًا في شراء Neocloud، يجعل الالتزامات بالخدمة المقدمة عاملاً صريحًا في مفاوضات التسعير. المُزوِّدون الذين لا يمتلكون التزامات بالخدمة المقدمة التنافسية يفقدون الصفقات الآن.

بعد ذلك، يأتي بُعد المتانة. يُتوقع من العملاء المؤسسيون، الذين تم تشكيلهم بواسطة AWS S3 و Azure Blob، متانة 11 إلى 12 ناين. يمكن أن تقع هياكل تخزين HPC التقليدية المبنية على RAID المحلي دون 5 ناينات في النطاق اعتمادًا على معدلات فشل الأقراص ونافذة إعادة البناء، مما قد يؤدي إلى فقدان آلاف الملفات سنويًا عبر مجموعة من مليار ملف. يمكن أن يُجاوز الترميز التحريري المتعدد المستويات 11 ناين. الفجوة بين هاتين الحقيقتين هي الفرق بين نظام تخزين يمكنك ضمانه بالفعل وآخر لا يمكنك.

ما هي قدرات التخزين الأكثر احتمالاً لتحدد استمرار Neocloud على المدي الطويل من خلال التكامل؟

المشغلون الذين سيبقون على قيد الحياة سيكونون أولئك الذين حلوا معادلة التكلفة الإجمالية للملكية عبر كامل هيكل البنية التحتية، وليس فقط معادلة شراء GPU. هذا يعني عدة قدرات محددة.

أولاً، هيكل برمجي موحد يُشغل الفلاش والقرص على نفس طائرة البيانات مع تدرج أداء عالي وأي مُحوِّلات بيانات خارجية، ولا طبقة برمجية ثانية، ولا تعقيد تشغيلي يُقدم من ربط أنظمة منفصلة. ثانيًا، تخزين يمكن أن يركب منحنيات التكلفة المستقلة للفلاش والقرص بينما تتحرك الأسواق بشكل مستقل. ثالثًا، أنظمة ذاتية التعافي التي تحتفظ بالتوافر العالي دون مشرفين متخصصين يُؤدون استعادة يدوية في الساعة 3 صباحًا. التخزين المعقد تشغيلي هو تكلفة غير مرئية تتراكم في النطاق. رابعًا، متانة يمكن أن تُؤمن بالفعل في الالتزام بالخدمة المقدمة مقابل معايير Hyperscaler.

النقطة الأوسع هي أن موجة التكامل تُفصل بين البنية التحتية المبنية لتقديرات اليوم الأول والبنية التحتية المبنية لاقتصاد السنة الثالثة. انخفضت أسعار إيجار H100 بنسبة أكثر من 60 في المائة من الذروة. السوق لا يُكافئ بعد ذلك تجميع GPU. إنه يُطالب ببرهان على عائد الاستثمار.

ما هو رسالتك لمشغلي Neocloud الذين يُقيِّمون استراتيجية التخزين الخاصة بهم اليوم؟

لا تدع قرار التخزين يكون القرار الذي اتخذته افتراضيًا. كل جزء آخر من هيكل البنية التحتية يُخضع لتدقيق هندسي ومالي صارم. التخزين يجب أن يكون مختلفًا. المشغلون الذين سيبقون هنا في ثلاث سنوات هم أولئك الذين نظروا بجدية إلى تكلفة الحوسبة المفيدة لكل ساعة GPU الحقيقي، وفهموا موقفهم الفعلي للتوافر، واكدوا أنهم قد تم تحديدهم للعمل بدلاً من اختصار الشراء.

نافذة الحصول على هذا正确ًا تضيق. التكامل已经 قيد التنفيذ، والاقتصاد قاسٍ. لكن للمشغلين الذين يرغبون في إعادة التفكير في طبقة التخزين بنفس الصرامة التي طبقوها على اختيار GPU، الفرصة كبيرة. التخزين المُنجز بشكل صحيح لا يُقلل فقط من التكلفة. إنه يُفتح القيمة الكاملة لكل GPU في الراك.

شكرًا على المقابلة العظيمة، القراء الذين يرغبون في معرفة المزيد عن هذه المكدس التقني يجب أن يزوروا VDURA. كما يمكنهم قراءة مقابلتنا السابقة مع كين كلافي.

أنطوان هو قائد رؤيوي وشريك مؤسس في Unite.AI، مدفوعًا برغبة لا تكل في تشكيل وتعزيز مستقبل الذكاء الاصطناعي والروبوتات. وهو رائد أعمال متسلسل، يعتقد أن الذكاء الاصطناعي سيكون مدمرًا للمجتمع مثل الكهرباء، وغالبًا ما يُقبض عليه وهو يثرثر عن إمكانات التكنولوجيا المثيرة للدهشة والذكاء الاصطناعي العام.

كما أنه مستقبلي، فهو مخصص لاستكشاف كيف ستشكل هذه الابتكارات العالم. بالإضافة إلى ذلك، فهو مؤسس Securities.io، وهي منصة تركز على الاستثمار في التكنولوجيا المتقدمة التي تعيد تعريف المستقبل وتعيد تشكيل القطاعات بأكملها.