قادة الفكر
نماذج اللغة المخصصة لجميع الأعمال؟ DeepSeek تظهر لنا الطريق

في الماضي، كان نداء التكنولوجيا هو “هاتف محمول للجميع” – وفي الواقع، أصبحت الاتصالات المتنقلة ثورة في الأعمال (والعالم). اليوم، المكافئ لهذا النداء هو منح الجميع الوصول إلى تطبيقات الذكاء الاصطناعي. لكن القوة الحقيقية للذكاء الاصطناعي تكمن في استخدامه لاحتياجات الأعمال والمنظمات المحددة. المسار الذي سلكته شركة DeepSeek الصينية يظهر كيف يمكن للذكاء الاصطناعي أن يستخدم من قبل الجميع، خاصة تلك التي لديها ميزانيات محدودة، لتحقيق احتياجاتها المحددة. في الواقع، ظهور الذكاء الاصطناعي منخفض التكلفة يعد تطورًا إيجابيًا للقطاع، حيث سيؤدي إلى زيادة استخدام الذكاء الاصطناعي بشكل عام، مما يؤدي إلى نمو الجميع، من المطورين إلى مصنعي الشريحة إلى المستخدمين النهائيين.
كانت نماذج اللغة الكبيرة – أو كانت – مشروعًا مكلفًا، يتطلب الوصول إلى كميات هائلة من البيانات، وأعدادًا كبيرة من الحواسيب القوية لمعالجة البيانات، والوقت والموارد المستثمرة في تدريب النموذج. لكن هذه القواعد تتغير. تعمل شركة DeepSeek على ميزانية منخفضة، وطورت نموذجها الخاص من الذكاء الاصطناعي، وتطبيقًا من نوع ChatGPT للاستفسارات – مع استثمار أقل بكثير من تلك التي بنيت من قبل الشركات الأمريكية والأوروبية. يفتح نهج DeepSeek نافذة إلى تطوير نماذج اللغة الكبيرة للشركات الصغيرة التي لا تمتلك مليارات الدولارات للإنفاق. في الواقع، قد لا يكون يوم بعيد عندما يتمكن معظم الشركات الصغيرة من تطوير نماذج اللغة الكبيرة الخاصة بها لتحقيق أهدافها المحددة، مما يوفر حلًا أكثر فعالية من النماذج الكبيرة مثل ChatGPT.
في حين أن هناك جدلًا حول التكلفة الحقيقية لشركة DeepSeek، فإن الأمر لا يقتصر على التكلفة فقط؛ بل يتعلق بالحقيقة التي اعتمدت عليها الشركة على شرائح أقل تقدمًا ونهجًا أكثر تركيزًا في تدريب النموذج. كشركة صينية خاضعة للقيود الأمريكية على التصدير، لم تتمكن شركة DeepSeek من الوصول إلى شرائح نيفيديا المتقدمة التي يتم استخدامها عادةً لمعالجة الحوسبة الثقيلة المطلوبة لتطوير نماذج اللغة الكبيرة، وتمت إجبارها على استخدام شرائح نيفيديا أتش-800 الأقل قوة، والتي لا يمكنها معالجة البيانات بسرعة أو كفاءة. (NVDA )
为了弥补这种缺乏力量,DeepSeek 采取了不同的、更集中的和直接的方法来开发其语言模型。与其将大量数据扔给模型并依赖计算能力来标记和应用数据,DeepSeek 将训练缩小到一个小的、高质量的“冷启动”数据,并应用 IRL(迭代强化学习),使算法将数据应用于不同的场景并从中学习。这一集中的方法使模型能够更快地学习,犯错更少,浪费的计算能力更少。
类似于父母如何指导婴儿的特定动作,帮助他们成功地翻过身来 – 而不是让婴儿自己去弄清楚,或者教他们更广泛的动作,这可能有助于翻身 – 训练这些更集中的 AI 模型的数据科学家专注于什么是最需要的任务和结果。这些模型可能没有像 ChatGPT 这样的更大型语言模型那样广泛的应用,但它们可以被依靠来执行特定的任务,并以精确和高效的方式执行。甚至 DeepSeek 的批评者也承认,其开发的简化方法显著提高了效率,使其能够用更少的资源做更多的事情。
这种方法是关于给 AI 最好的输入,以便它能够以最聪明和最有效的方式达到其里程碑,并且对于任何希望开发语言模型以满足其特定需求和任务的组织来说都是有价值的。这种方法对于小型企业和组织越来越有价值。第一步是从正确的数据开始。例如,一家公司希望使用 AI 来帮助其销售和营销团队,应该在精心选择的数据集上训练其模型,该数据集专注于销售对话、策略和指标。这可以防止模型浪费时间和计算能力在不相关的信息上。另外,训练需要分阶段进行,确保模型掌握每个任务或概念,然后再转到下一个任务。
这也与养育婴儿类似,就像我自己几个月前成为母亲后所学到的那样。在这两种情况下,一个引导的、分步骤的方法可以避免浪费资源和减少摩擦。最后,这种方法,无论是对婴儿还是 AI 模型,都会带来迭代的改进。随着婴儿的成长或模型的学习,其能力也会提高。这意味着模型可以被改进和完善,以更好地处理现实世界的情况。
这种方法可以降低成本,防止 AI 项目成为资源的浪费,使其更容易被小型团队和组织使用。它还可以更快地提高 AI 模型的性能;并且,由于模型不被过多的数据所淹没,因此可以更容易地适应新信息和不断变化的业务需求 – 这在竞争激烈的市场中至关重要。
DeepSeek 和更低成本、更高效的 AI 世界的到来 – 虽然最初在 AI 世界和股票市场上引起了恐慌 – 但总体而言,这是 AI 领域的一个积极发展。AI 的更高效和更低的成本,至少对于某些专注的应用,终将导致 AI 的使用更加广泛,这将推动所有人的增长,从开发者到芯片制造商到最终用户。事实上,DeepSeek 说明了 杰文斯悖论 – 即更高的效率可能会导致资源的使用增加,而不是减少。随着这一趋势的继续,小型企业如果专注于使用 AI 来满足其特定需求,也将更好地实现增长和成功。












