Lãnh đạo tư tưởng

Các Mô Hình LLM Tùy Chỉnh Cho Mọi Doanh Nghiệp? DeepSeek Chỉ Ra Con Đường

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Ngày xưa, lời kêu gọi công nghệ là “điện thoại di động cho mọi người” – và thực sự, giao tiếp di động đã cách mạng hóa kinh doanh (và thế giới). Ngày nay, lời kêu gọi tương đương là cung cấp cho mọi người quyền truy cập vào các ứng dụng trí tuệ nhân tạo. Nhưng sức mạnh thực sự của trí tuệ nhân tạo nằm ở việc tận dụng nó cho các nhu cầu cụ thể của doanh nghiệp và tổ chức. Con đường được vạch ra bởi công ty khởi nghiệp Trung Quốc DeepSeek chứng tỏ rằng trí tuệ nhân tạo có thể được tận dụng bởi mọi người, đặc biệt là những người có ngân sách hạn chế, để đáp ứng nhu cầu cụ thể của họ. Thực sự, sự xuất hiện của trí tuệ nhân tạo giá thấp hơn hứa hẹn sẽ thay đổi mẫu hình sâu sắc của các giải pháp trí tuệ nhân tạo thường nằm ngoài tầm với của nhiều doanh nghiệp nhỏ và tổ chức do yêu cầu chi phí.

Các mô hình ngôn ngữ lớn (LLM) – hoặc đã từng là – một nỗ lực tốn kém, đòi hỏi truy cập vào lượng dữ liệu lớn, số lượng máy tính mạnh để xử lý dữ liệu, và thời gian và tài nguyên đầu tư vào việc đào tạo mô hình. Nhưng những quy tắc đó đang thay đổi. Hoạt động trên một ngân sách hạn chế, DeepSeek đã phát triển mô hình LLM của riêng mình, và một ứng dụng loại ChatGPT cho các truy vấn – với một khoản đầu tư nhỏ hơn nhiều so với các hệ thống tương tự được xây dựng bởi các công ty Mỹ và châu Âu. Cách tiếp cận của DeepSeek mở ra một cửa sổ vào sự phát triển của LLM cho các tổ chức nhỏ hơn không có hàng tỷ đô la để chi tiêu. Thực sự, ngày mà hầu hết các tổ chức nhỏ có thể phát triển mô hình LLM của riêng mình để phục vụ mục đích cụ thể của họ có thể không còn xa, thường cung cấp một giải pháp hiệu quả hơn so với các mô hình LLM chung như ChatGPT.

Mặc dù đề bài vẫn còn về chi phí thực sự của DeepSeek, nó không chỉ là chi phí khiến nó và các mô hình tương tự khác biệt: Đó là việc nó dựa vào các chip ít tiên tiến hơn và một cách tiếp cận tập trung hơn vào việc đào tạo. Là một công ty Trung Quốc chịu các hạn chế xuất khẩu của Mỹ, DeepSeek không thể truy cập vào các chip Nvidia tiên tiến thường được sử dụng cho tính toán nặng cần thiết cho sự phát triển của LLM, và do đó buộc phải sử dụng các chip Nvidia H-800 ít mạnh mẽ hơn (NVDA ), không thể xử lý dữ liệu nhanh chóng hoặc hiệu quả.

Để bù đắp cho sự thiếu hụt sức mạnh đó, DeepSeek đã thực hiện một cách tiếp cận khác, tập trung và trực tiếp hơn vào việc phát triển LLM của mình. Thay vì ném các ngọn núi dữ liệu vào một mô hình và dựa vào sức mạnh tính toán để gắn nhãn và áp dụng dữ liệu, DeepSeek đã thu hẹp việc đào tạo, sử dụng một lượng nhỏ dữ liệu “cold-start” chất lượng cao và áp dụng IRL (học tăng cường lặp lại, với thuật toán áp dụng dữ liệu vào các kịch bản khác nhau và học hỏi từ nó). Cách tiếp cận tập trung này cho phép mô hình học nhanh hơn, với ít sai sót và ít lãng phí sức mạnh tính toán.

Tương tự như cách cha mẹ có thể hướng dẫn các chuyển động cụ thể của một em bé, giúp em bé lăn qua lại thành công lần đầu tiên – chứ không phải để em bé tự tìm ra hoặc dạy em bé một loạt các chuyển động có thể giúp em bé lăn qua lại – các nhà khoa học dữ liệu đào tạo các mô hình trí tuệ nhân tạo tập trung này zoom vào những gì cần thiết nhất cho các nhiệm vụ và kết quả cụ thể. Những mô hình như vậy có thể không có ứng dụng đáng tin cậy rộng rãi như các mô hình LLM lớn như ChatGPT, nhưng chúng có thể được tin cậy cho các ứng dụng cụ thể, và thực hiện các ứng dụng đó với độ chính xác và hiệu quả. Thậm chí các nhà phê bình của DeepSeek cũng thừa nhận rằng cách tiếp cận phát triển tinh gọn của nó đã tăng đáng kể hiệu suất, cho phép nó làm được nhiều hơn với ít hơn.

Cách tiếp cận này là về việc cung cấp cho trí tuệ nhân tạo các đầu vào tốt nhất để nó có thể đạt được các cột mốc của mình theo cách thông minh và hiệu quả nhất, và có thể có giá trị cho bất kỳ tổ chức nào muốn phát triển một LLM cho nhu cầu và nhiệm vụ cụ thể của mình. Cách tiếp cận như vậy ngày càng có giá trị cho các doanh nghiệp nhỏ và tổ chức. Bước đầu tiên là bắt đầu với dữ liệu đúng. Ví dụ, một công ty muốn sử dụng trí tuệ nhân tạo để giúp các đội bán hàng và tiếp thị của mình nên đào tạo mô hình của mình trên một tập dữ liệu được chọn cẩn thận, tập trung vào các cuộc trò chuyện bán hàng, chiến lược và chỉ số. Điều này giữ cho mô hình không lãng phí thời gian và sức mạnh tính toán vào thông tin không liên quan. Ngoài ra, việc đào tạo cần được cấu trúc theo các giai đoạn, đảm bảo mô hình掌握 từng nhiệm vụ hoặc khái niệm trước khi chuyển sang nhiệm vụ hoặc khái niệm tiếp theo.

Điều này cũng có những điểm tương đồng trong việc nuôi dạy một em bé, như tôi đã học được kể từ khi trở thành một người mẹ vài tháng trước. Trong cả hai trường hợp, một cách tiếp cận hướng dẫn, từng bước tránh lãng phí tài nguyên và giảm ma sát. Cuối cùng, cách tiếp cận như vậy với cả em bé và mô hình trí tuệ nhân tạo dẫn đến sự cải thiện lặp lại. Khi em bé lớn lên, hoặc mô hình học hỏi nhiều hơn, khả năng của nó được cải thiện. Điều này có nghĩa là mô hình có thể được tinh chỉnh và cải thiện để xử lý tốt hơn các tình huống thực tế.

Cách tiếp cận này giữ chi phí thấp, ngăn chặn các dự án trí tuệ nhân tạo trở thành một cơn ác mộng về tài nguyên, làm cho chúng dễ tiếp cận hơn với các đội và tổ chức nhỏ. Nó cũng dẫn đến hiệu suất tốt hơn của các mô hình trí tuệ nhân tạo nhanh hơn; và, vì các mô hình không bị quá tải với dữ liệu không cần thiết, chúng cũng có thể được điều chỉnh để thích nghi với thông tin mới và nhu cầu kinh doanh thay đổi – điều quan trọng trong các thị trường cạnh tranh.

Sự xuất hiện của DeepSeek và thế giới trí tuệ nhân tạo giá thấp hơn, hiệu quả hơn – mặc dù ban đầu nó lan truyền sự hoảng loạn trong thế giới trí tuệ nhân tạo và thị trường chứng khoán – nhưng tổng thể là một sự phát triển tích cực cho lĩnh vực trí tuệ nhân tạo. Sự hiệu quả và chi phí thấp hơn của trí tuệ nhân tạo, ít nhất là đối với các ứng dụng tập trung, sẽ cuối cùng dẫn đến việc sử dụng nhiều hơn trí tuệ nhân tạo nói chung, điều này thúc đẩy sự tăng trưởng cho mọi người, từ các nhà phát triển đến các nhà sản xuất chip đến người dùng cuối. Thực sự, DeepSeek minh họa định lý Jevons – nơi hiệu quả hơn sẽ có khả năng dẫn đến việc sử dụng nhiều hơn một tài nguyên, không ít hơn. Khi xu hướng này có vẻ sẽ tiếp tục, các doanh nghiệp nhỏ tập trung vào việc sử dụng trí tuệ nhân tạo để đáp ứng nhu cầu cụ thể của họ cũng sẽ được đặt tốt hơn cho sự tăng trưởng và thành công.

Stav Levi-Neumark là CEO & Co-founder của Alta và là chuyên gia về quản lý sản phẩm và tăng trưởng doanh thu. Trước đó, cô là một trong những nhân viên đầu tiên tại Monday.com, nơi cô đã giúp phát triển "BigBrain", một công cụ BI nội bộ được sử dụng cho các hoạt động hàng ngày của công ty. Stav holds một bằng Cử nhân Khoa học về khoa học máy tính và thống kê từ Đại học Hebrew của Jerusalem.