AI 模型与平台

蒸餾巨人:為什麼我們必須重新思考小型 AI 開發

mm
将 Unite.AI 添加到您在 Google 上的首选来源

近年來,科技業界一直在競爭開發越來越大的 AI 模型。這些模型具有數十億個參數,承諾在自然語言處理、圖像識別等領域取得突破性的進展。然而,這種不懈的追求大小帶來了顯著的缺點,包括高昂的成本和顯著的環境影響。雖然小型 AI 提供了一種有前途的替代方案,提供了效率和較低的能源消耗,但目前建造它的方法仍然需要大量的資源。當我們追求小型和更可持續的 AI 時,探索新的策略以有效地解決這些限制是至關重要的。

小型 AI:解決高成本和能源需求的可持續解決方案

開發和維護大型 AI 模型是一項昂貴的工作。估計訓練 GPT-3 的成本超過 400 萬美元,更加先進的模型可能會達到數千萬美元。這些成本,包括必要的硬件、儲存、計算能力和人力資源,對於許多組織,尤其是小型企業和研究機構,來說是難以承受的。這種財務障礙創造了一個不平等的競爭環境,限制了對尖端 AI 技術的訪問,阻礙了創新。

此外,大型 AI 模型的能源需求令人震驚。例如,訓練一個大型語言模型如 GPT-3,被估計消耗了近 1,300 百萬瓦時(MWh)的電力,相當於 130 個美國家庭的一年用電量。儘管這種巨大的訓練成本,每個 ChatGPT 請求都會產生 2.9 瓦時的推理成本。國際能源署估計,AI、數據中心和加密貨幣的集體能源需求佔全球能源需求的近 2%。這種需求預計將在 2026 年之前翻倍,接近日本的總電力消耗。高能源消耗不僅增加了運營成本,也加劇了碳足跡,惡化了環境危機。為了更好地理解,研究人員估計,訓練一個大型 AI 模型可以排放超過 626,000 磅的二氧化碳,相當於五輛汽車在其生命周期中的排放量。

在這些挑戰中,小型 AI 提供了一種實用的解決方案。它被設計為更高效和可擴展,需要的數據和計算能力更少。這減少了整體成本,使先進的 AI 技術更容易被小型組織和研究團隊所接觸。另外,小型 AI 模型的能源需求更低,有助於降低運營成本和減少其環境影響。通過使用優化的算法和方法,如轉移學習,小型 AI 可以在較少的資源下實現高性能。這種方法不僅使 AI 更加經濟,而且支持可持續性,同時最小化能源消耗和碳排放。

小型 AI 模型如何構建

認識到小型 AI 的優勢,谷歌、OpenAI 和 Meta 等主要科技公司越來越注重開發緊湊的模型。這種轉變導致了 Gemini Flash、GPT-4o Mini 和 Llama 7B 等模型的演變。這些較小的模型主要使用了一種稱為知識蒸餾的技術。

在其核心,蒸餾涉及將大型、複雜模型的知識轉移到一個較小、更高效的版本中。在這個過程中,一個“教師”模型(大型 AI 模型)在大量數據上進行訓練,以學習複雜的模式和細微差別。這個模型然後生成預測或“軟標籤”,它們封裝了其深入的理解。

“學生”模型,即小型 AI 模型,則被訓練以複製這些軟標籤。通過模仿教師的行為,學生模型捕捉到了大量的知識和性能,而只使用了相對較少的參數。

為什麼我們需要超越蒸餾大型 AI

雖然將大型 AI 蒸餾成小型、更易於管理的版本已經成為構建小型 AI 的一種流行方法,但有幾個令人信服的理由為什麼這種方法可能不是解決所有大型 AI 開發挑戰的解決方案。

  • 繼續依賴大型模型:雖然蒸餾創建了更小、更高效的 AI 模型,並在推理時間提高了計算和能源效率,但它仍然在初始階段大量依賴訓練大型 AI 模型。這意味著構建小型 AI 模型仍然需要大量的計算資源和能源,從而導致高昂的成本和環境影響。蒸餾的需求將資源負擔從小型模型轉移到大型模型,而不是消除它。儘管蒸餾旨在減少 AI 模型的大小和費用,但它並不能消除訓練大型“教師”模型所需的巨大初始成本。這些前期費用對於小型組織和研究小組來說尤其具有挑戰性。此外,訓練這些大型模型的環境影響可能會抵消使用小型、更高效模型的一些好處,因為初始訓練階段的碳足跡仍然顯著。
  • 創新範圍有限:依賴蒸餾可能會限制創新,因為它側重於複製現有的大型模型,而不是探索新的方法。這可能會減慢新型 AI 結構或方法的開發速度,這些方法可能會為特定問題提供更好的解決方案。對大型 AI 的依賴限制了小型 AI 的開發,使其僅在少數資源豐富的公司手中。因此,小型 AI 的好處並不均勻分佈,這可能會阻礙更廣泛的技術進步和創新機會。
  • 泛化和適應挑戰:通過蒸餾創建的小型 AI 模型通常難以處理新的、未見過的數據。這是因為蒸餾過程可能無法完全捕捉到大型模型的泛化能力。因此,雖然這些較小的模型可能在熟悉的任務中表現良好,但它們在面對新情況時往往會遇到困難。此外,將蒸餾模型適應新的模態或數據集通常需要先重新訓練或微調大型模型。這個迭代過程可能很複雜,需要大量資源,使得快速適應小型 AI 模型以滿足快速演變的技術需求或新應用成為一項挑戰。

結論

雖然蒸餾大型 AI 模型成小型模型似乎是一種實用的解決方案,但它仍然依賴於訓練大型模型的高昂成本。要真正在小型 AI 上取得進展,我們需要探索更多創新和可持續的實踐。這意味著創建針對特定應用程序的模型,改進訓練方法以使其更具成本效益和能源效率,並關注環境可持續性。通過這些策略,我們可以以對行業和地球都有益的方式推動 AI 的發展。

Dr. Tehseen Zia 是 COMSATS University Islamabad 的终身副教授,拥有来自奥地利维也纳科技大学的人工智能博士学位。专攻人工智能、机器学习、数据科学和计算机视觉,他在著名的科学期刊上发表了重要贡献。 Dr. Tehseen 还作为首席调查员领导了各种工业项目,并担任人工智能顾问。