Lãnh đạo tư tưởng
Sự trỗi dậy của Dữ liệu Tổng hợp và Tại sao Nó Sẽ Tăng cường Thay vì Thay thế Dữ liệu Thực

Elon Musk gần đây đã tuyên bố rằng chúng ta đã cạn kiệt dữ liệu của con người để đào tạo các mô hình AI. Cảnh báo của ông là bình luận mới nhất về nhu cầu nguồn dữ liệu mới nếu AI tiếp tục tiến bộ nhanh chóng. Trong các ngành như chăm sóc sức khỏe và tài chính, các quy định về quyền riêng tư nghiêm ngặt đang làm cho sự khan hiếm dữ liệu trở nên cấp thiết hơn.
Trong khi dữ liệu tổng hợp – một giải pháp có thể cho sự khan hiếm này – không phải là mới, tầm quan trọng của nó vẫn tiếp tục tăng, như được minh họa bằng các vụ sáp nhập và đầu tư gần đây trong lĩnh vực này. Tuy nhiên, có một số sự không chắc chắn sâu sắc xung quanh việc sử dụng dữ liệu tổng hợp, đặc biệt là rủi ro sụp đổ mô hình, nơi chất lượng đầu ra của mô hình ngôn ngữ lớn (LLM) giảm đi mà không có dữ liệu thế giới thực để đào tạo. Liệu vấn đề này có thể được giải quyết hay không có thể có tác động đáng kể đến tương lai của trí tuệ nhân tạo sinh (Gen AI).
Dữ liệu tổng hợp là gì và nó được tạo ra như thế nào?
Dữ liệu tổng hợp được tạo ra một cách nhân tạo chứ không phải được thu thập từ các sự kiện thực. Dữ liệu tổng hợp được tạo ra bởi AI hiện nay là hình thức phổ biến nhất, liên quan đến việc đào tạo các mô hình trên dữ liệu thế giới thực để phát hiện các mẫu và mối tương quan, sau đó tạo ra dữ liệu mới bắt chước các thuộc tính thống kê này.
Các mô hình ngôn ngữ lớn (LLM) đang được sử dụng để tạo ra nhiều loại dữ liệu tổng hợp, bao gồm dữ liệu có cấu trúc, chẳng hạn như dữ liệu bảng, và dữ liệu không có cấu trúc, như văn bản tự do, video và hình ảnh. Một loạt các phương pháp được sử dụng, tùy thuộc vào loại dữ liệu được tạo ra.
Ví dụ, hai phương pháp phổ biến được triển khai để tạo ra dữ liệu hình ảnh tổng hợp là GAN và mô hình khuếch tán. GAN sử dụng hai mạng nơ-ron: một mạng tạo ra các phiên bản nhân tạo của dữ liệu thực, trong khi một mạng khác xác định哪 là thực và được tạo ra. Làm việc cùng nhau liên tục, mạng tạo ra cố gắng “lừa” mạng khác, liên tục cải thiện tính thực tế và đa dạng của dữ liệu nhân tạo. Mô hình khuếch tán thực hiện một cách tiếp cận khác, học cách làm sai lệch dữ liệu thực và sau đó đảo ngược quá trình này để “làm sạch” nó. Một khi được đào tạo hiệu quả, chúng có thể tạo ra dữ liệu tổng hợp chất lượng cao.
Tầm quan trọng ngày càng tăng của dữ liệu tổng hợp
Đã có sự quan tâm lâu dài đến dữ liệu tổng hợp. Tuy nhiên, trong 5 năm qua, sự phát triển nhanh chóng của các mô hình ngôn ngữ lớn (LLM) đã làm tăng nhu cầu về dữ liệu tổng hợp và tạo ra một phương tiện hiệu quả hơn để tạo ra nó với quy mô lớn. Kết quả là, việc sử dụng dữ liệu tổng hợp đã tăng vọt.
Gartner dự báo rằng dữ liệu tổng hợp sẽ chiếm 60% tất cả dữ liệu được sử dụng để đào tạo các mô hình ngôn ngữ lớn (LLM) vào năm 2024, tăng từ chỉ 1% vào năm 2021. Có mọi lý do để tin rằng ước tính này là chính xác. Ví dụ, mô hình Phi-4 của Microsoft, đã vượt qua các mô hình LLM khác mặc dù nhỏ hơn, đã được đào tạo thành công trên dữ liệu tổng hợp chủ yếu. Trong khi đó, các kỹ sư của Amazon’s Alexa đang khám phá việc sử dụng mô hình “giáo viên/học sinh” nơi mô hình “giáo viên” tạo ra dữ liệu tổng hợp được sử dụng để tinh chỉnh mô hình “học sinh” nhỏ hơn.
Sự áp dụng rộng rãi này đang được phản ánh bởi các động thái lớn trên thị trường. Ngành dữ liệu tổng hợp đã chứng kiến một cơn bùng nổ đầu tư vào năm 2021-22. Gretel AI và Tonic.ai đã bảo đảm các vòng đầu tư Series B trị giá 50 triệu và 35 triệu đô la Mỹ. Những vụ này đã được tiếp theo bởi MOSTLY AI đóng vòng đầu tư Series B trị giá 25 triệu đô la và Synthesis AI bảo đảm 17 triệu đô la trong vòng đầu tư Series A.
Gần đây, xu hướng đã chuyển sang các vụ mua lại quy mô lớn. Vụ mua lại Gretel của NVIDIA vào mùa xuân này sẽ hỗ trợ cho công việc của gã khổng lồ công nghệ trong lĩnh vực này. Tương tự, công ty giải pháp AI SAS đã mua lại công ty khởi nghiệp dữ liệu tổng hợp Hazy vào tháng 11 năm 2024.
Công ty phân tích Cognilytica ước tính rằng thị trường tạo ra dữ liệu tổng hợp vào năm 2021 có giá trị khoảng 110 triệu đô la. Công ty dự kiến thị trường này sẽ đạt 1,15 tỷ đô la vào năm 2027. Các dự báo khác dự đoán tốc độ tăng trưởng hàng năm là 31% cho lĩnh vực này, khi nó phát triển lên 2,33 tỷ đô la vào năm 2030.
Sụp đổ mô hình
Tuy nhiên, tiềm năng thú vị của dữ liệu tổng hợp đi kèm với một nhược điểm đáng kể: sụp đổ mô hình. Đây là một hiện tượng trong đó các mô hình ngôn ngữ lớn (LLM) được đào tạo chỉ trên dữ liệu tổng hợp bắt đầu tạo ra đầu ra kém chính xác hoặc kém đa dạng hơn.
Trong khi dữ liệu thế giới thực có xu hướng cao về độ phức tạp, dữ liệu tổng hợp thường được đơn giản hóa và cô đặc bởi các mô hình. Ví dụ, các nhà nghiên cứu đã phát hiện ra rằng độ chính xác của một mô hình được đào tạo để phát hiện các nốt ruồi ung thư từ ảnh là liên quan nghịch đến lượng dữ liệu tổng hợp được sử dụng. Một nghiên cứu gần đây của các học giả từ Oxford, Cambridge, Imperial College và Đại học Toronto đã tìm thấy rằng việc sử dụng dữ liệu được tạo ra bởi mô hình một cách không phân biệt dẫn đến “các khiếm khuyết không thể khắc phục trong mô hình kết quả”.
Thậm chí còn tồi tệ hơn, hầu hết các mô hình ngôn ngữ lớn (LLM) là “hộp đen”, khiến cho việc hiểu cách chúng sẽ phản ứng với dữ liệu tổng hợp trở nên khó khăn. Các nhà nghiên cứu từ Đại học Rice và Stanford đã kết luận rằng không có dữ liệu thế giới thực mới, “các mô hình tạo ra trong tương lai sẽ bị suy giảm chất lượng (độ chính xác) hoặc đa dạng (tỷ lệ nhớ) một cách tiến triển”.
Sự cần thiết liên tục của dữ liệu thế giới thực
Rõ ràng, ngay cả với sự gia tăng nhu cầu về dữ liệu tổng hợp, nhu cầu về dữ liệu thế giới thực vẫn còn. Trên thực tế, nhu cầu về dữ liệu thế giới thực chất lượng cao có thể thậm chí tăng lên. Lý do cho điều này là hai yếu tố. Thứ nhất, dữ liệu thế giới thực sẽ luôn được cần để đào tạo các mô hình AI tạo ra dữ liệu tổng hợp. Thứ hai, để tránh sụp đổ mô hình, cần phải liên tục đồng bộ hóa dữ liệu tổng hợp với dữ liệu thế giới thực.
Dữ liệu thực để đào tạo mô hình tạo ra dữ liệu tổng hợp
Như đã đề cập trước đó, hầu hết dữ liệu tổng hợp ngày nay được tạo ra bằng cách sử dụng trí tuệ nhân tạo sinh (Gen AI). Và các mô hình Gen AI này phải được đào tạo trên dữ liệu thế giới thực để tạo ra dữ liệu tổng hợp có thể sử dụng. Đó là bởi vì chúng chỉ có thể tạo ra dữ liệu tổng hợp bằng cách sao chép các mẫu và thuộc tính thống kê của một tập dữ liệu thế giới thực.
Hãy xem xét ví dụ gần đây của một công ty bảo hiểm đã sử dụng dữ liệu tổng hợp để thử nghiệm các nhà cung cấp khác nhau mà không làm tổn hại đến dữ liệu khách hàng nhạy cảm của họ. Để tạo ra tập dữ liệu tổng hợp này, mô hình AI đã được đào tạo trên dữ liệu thực của chính công ty để tạo ra dữ liệu tổng hợp bắt chước thực tế.
Dữ liệu thực để giảm thiểu sụp đổ mô hình
Có nhiều chiến lược để giảm thiểu rủi ro sụp đổ mô hình. Chúng bao gồm việc xác thực và xem xét lại thường xuyên các tập dữ liệu tổng hợp, và kiểm tra chất lượng dữ liệu tổng hợp trước khi sử dụng nó trong các mô hình tạo ra. Tuy nhiên, phương pháp phổ biến nhất là đa dạng hóa dữ liệu được sử dụng bằng cách kết hợp dữ liệu tổng hợp với dữ liệu của con người. Khảo sát của Gartner đã tìm thấy rằng 63% người được hỏi ủng hộ việc sử dụng một tập dữ liệu tổng hợp một phần, với chỉ 13% cho biết họ sử dụng dữ liệu tổng hợp hoàn toàn.
Thậm chí việc thêm một lượng nhỏ dữ liệu thế giới thực cũng có thể cải thiện đáng kể hiệu suất của mô hình. Các nhà nghiên cứu từ Đại học Nam California đã phát hiện ra rằng các công ty có thể thay thế lên đến 90% dữ liệu thực của họ bằng dữ liệu tổng hợp mà không thấy sự suy giảm đáng kể về hiệu suất. Tuy nhiên, việc thay thế 10% dữ liệu của con người còn lại dẫn đến sự suy giảm đáng kể.
Chất lượng cũng rất quan trọng, như được minh họa bởi trường hợp của Microsoft với thành công của Phi-4. Mô hình ngôn ngữ lớn này được đào tạo trên dữ liệu tổng hợp chủ yếu được tạo ra bởi GPT-4o. Tuy nhiên, phần lớn dữ liệu đào tạo trước – một tập dữ liệu chung được sử dụng cho giai đoạn đầu của đào tạo trước khi mô hình được tinh chỉnh – là dữ liệu thế giới thực chất lượng cao được chăm sóc cẩn thận, bao gồm sách và bài báo nghiên cứu.
Lợi ích tiềm năng mà dữ liệu tổng hợp có thể mang lại
Khi dữ liệu tổng hợp được sử dụng một cách thông minh và kết hợp hiệu quả với dữ liệu thế giới thực, nó có tiềm năng giải quyết sáu vấn đề cụ thể khi nói đến dữ liệu đào tạo AI: sự khan hiếm, tính khả dụng, tính đồng nhất, thiên vị, vấn đề quyền riêng tư và chi phí.
Sự khan hiếm của dữ liệu
Khi các công ty AI cạnh tranh để giành thị phần và đạt được những thành tựu mới, nhu cầu về dữ liệu để đào tạo các mô hình ngôn ngữ lớn (LLM) của họ tăng lên. Dữ liệu tổng hợp có tiềm năng lấp đầy khoảng trống này, ít nhất là theo nghiên cứu của Gartner. Tuy nhiên, cần lưu ý rằng việc sử dụng một lượng đáng kể dữ liệu thực trong các tập dữ liệu đào tạo trước và để đồng bộ hóa với dữ liệu tổng hợp để tránh sụp đổ mô hình vẫn sẽ được cần.
Tính khả dụng của dữ liệu
Ngày càng nhiều, các công ty công nghệ lớn đang đóng vai trò là người giám sát khi nói đến dữ liệu, tạo ra một rào cản đối với các công ty nhỏ hơn. Dữ liệu tổng hợp có tiềm năng dân chủ hóa trí tuệ nhân tạo sinh (Gen AI) bằng cách làm cho lượng lớn dữ liệu đào tạo trở nên phải chăng và có thể tiếp cận. Tuy nhiên, điều này sẽ không loại bỏ trách nhiệm của các công ty công nghệ lớn trong việc cải thiện quyền truy cập vào dữ liệu thế giới thực, vì nó vẫn cần thiết cho việc đào tạo các mô hình tạo ra dữ liệu tổng hợp.
Tính đồng nhất của dữ liệu
Trong một số trường hợp sử dụng đặc biệt, như đào tạo AI cho lái xe tự động, các tập dữ liệu thế giới thực quá đồng nhất. Trong trường hợp lái xe, các nhà phát triển có thể tạo ra dữ liệu tổng hợp để lấp đầy khoảng trống trong dữ liệu cho các tình huống bất thường. Điều này cho phép các mô hình được đào tạo cho các sự kiện hiếm gặp trên đường.
Thiên vị
Một số tập dữ liệu thế giới thực chứa các thiên vị vốn có, vì vậy dữ liệu tổng hợp có thể được tạo ra để đảm bảo các mô hình AI nhận được một bức tranh cân bằng hơn. Ví dụ, trong lĩnh vực tài chính, Cơ quan Quản lý Tài chính (FCA) của Anh đã lập luận rằng dữ liệu tổng hợp có tiềm năng chống lại các thiên vị tiềm ẩn do một số nhóm bị đại diện thấp trong các tập dữ liệu của con người.
Quyền riêng tư
Trong các lĩnh vực như chăm sóc sức khỏe và tài chính, các yêu cầu về quyền riêng tư đang làm cho sự khan hiếm dữ liệu trở nên cấp thiết hơn. Với dữ liệu tổng hợp, các công ty có thể xây dựng các tập dữ liệu đào tạo cho các mô hình của họ chứa dữ liệu đặc biệt mà không làm tổn hại đến quyền riêng tư của khách hàng. Tuy nhiên, như một báo cáo được ủy thác bởi Hội Hoàng gia Anh đã chỉ ra với tham chiếu đến dữ liệu tổng hợp trong nghiên cứu y tế, có một giả định rằng dữ liệu tổng hợp “vốn dĩ là riêng tư”. Đây là một “sai lầm”. Như các nhà nghiên cứu chỉ ra, dữ liệu tổng hợp có thể tiết lộ thông tin về dữ liệu mà nó được衍生.
Cụ thể, các mô hình được đào tạo trên dữ liệu nhạy cảm dễ bị tấn công bởi các cuộc tấn công đảo ngược mô hình, nơi các hacker có thể tái tạo lại các phần của tập dữ liệu gốc.
Chi phí
Nói chung, dữ liệu tổng hợp được tạo ra với chi phí thấp hơn so với dữ liệu thế giới thực. Nó cũng đi kèm với nhãn, giúp tiết kiệm thời gian và chi phí. Trong một số dự án đào tạo AI, lên đến 80% dự án được dành cho việc chuẩn bị dữ liệu, bao gồm cả việc gắn nhãn. Điều này giải thích tại sao các công ty chuyên dụng đã xuất hiện để tìm nguồn lao động giá rẻ để đáp ứng nhu cầu xử lý dữ liệu của các gã khổng lồ Thung lũng Silicon.
Tăng cường thay vì thay thế dữ liệu thực
Những lợi ích của dữ liệu tổng hợp có thể được tận dụng, với điều kiện nó không được coi là thay thế cho dữ liệu thực. Thay vào đó, vai trò của nó nên là tăng cường các tập dữ liệu thực, cung cấp cách để tăng số lượng điểm dữ liệu có sẵn.
Để đặt điều này vào bối cảnh, mô hình ngôn ngữ lớn sắp tới của Meta, LLAMA Behemoth, đang được đào tạo trên 30 nghìn tỷ điểm dữ liệu. Rõ ràng, việc tìm kiếm dữ liệu thế giới thực với quy mô này là một thách thức, nếu không nói là không thể. Tuy nhiên, như đã lưu ý, việc sử dụng dữ liệu thế giới thực vẫn là điều cần thiết, cho dù đó là để đào tạo các mô hình tạo ra dữ liệu tổng hợp hay để đồng bộ hóa với dữ liệu tổng hợp để đảm bảo độ chính xác và tránh sụp đổ mô hình. Ở quy mô mà các mô hình ngôn ngữ lớn đang hoạt động, ngay cả khi dữ liệu tổng hợp chiếm một tỷ lệ đáng kể trong dữ liệu đào tạo được sử dụng, vẫn sẽ có nhu cầu đáng kể về dữ liệu thế giới thực. Và điều này có nghĩa là sẽ vẫn còn những vấn đề phức tạp để giải quyết xung quanh việc kiểm soát, truy cập, thiên vị, chi phí và thời gian.












