Mô hình và nền tảng AI
Cảm giác trực giác mới của Trí tuệ nhân tạo: Tại sao việc suy nghĩ thông minh hơn là quan trọng hơn việc suy nghĩ lâu hơn

Sự phát triển của trí tuệ nhân tạo (AI) đã được thúc đẩy bởi niềm tin rằng việc tăng dữ liệu và sức mạnh tính toán có thể cải thiện hiệu suất. Cách tiếp cận “lực lượng thô” này đã dẫn đến các hệ thống AI ấn tượng, chẳng hạn như GPT-3, đã hoạt động đáng kinh ngạc trong những năm qua. Tuy nhiên, mô hình này đang đạt đến giới hạn của nó. Khi các vấn đề AI trở nên phức tạp hơn, rõ ràng là việc thêm nhiều sức mạnh tính toán hơn sẽ không phải là một giải pháp bền vững hoặc hiệu quả cho tiến bộ lâu dài. Sự nhận thức này đã thúc đẩy các nhà nghiên cứu phải suy nghĩ lại cách tiếp cận của họ đối với sự phát triển của AI. Trong bối cảnh này, mô hình Cogito v2 của Deep Cogito giới thiệu một cách tiếp cận mới có thể thay đổi tương lai của sự phát triển AI. Thay vì dựa vào sức mạnh tính toán nhiều hơn hoặc lý luận mở rộng, Cogito v2 phát triển “cảm giác trực giác” nội bộ giúp mô hình xác định đúng đường dẫn trước khi bắt đầu tìm kiếm. Đây là một sự thay đổi mô hình trong cách AI đang được phát triển bằng cách tập trung vào việc suy nghĩ thông minh hơn, không phải lâu hơn.
Sự thay đổi trong phát triển AI
Trong nhiều năm, động lực chính đằng sau sự phát triển của AI là ý tưởng rằng “nhiều hơn là tốt hơn”. Cách tiếp cận này đã dẫn đến các mô hình AI tạo ra các chuỗi lý luận rộng lớn để giải quyết các vấn đề phức tạp. Các mô hình của OpenAI, chẳng hạn như GPT-3, là một ví dụ về cách tiếp cận này, nơi các chuỗi suy nghĩ dài hơn đã dẫn đến kết quả ấn tượng trên các nhiệm vụ khó khăn. Mặc dù phương pháp này đã mang lại kết quả ấn tượng, nhưng nó cũng có những hạn chế đáng kể. Các chuỗi lý luận dài hơn đòi hỏi nhiều tài nguyên tính toán hơn, dẫn đến thời gian suy luận chậm hơn và chi phí hoạt động cao hơn. Hơn nữa, nghiên cứu đã chỉ ra rằng các quá trình mở rộng này thường dẫn đến hiệu quả giảm dần, nơi suy nghĩ dài hơn dẫn đến sự thiên vị lớn hơn và hiệu quả thấp hơn. Vấn đề cơ bản là việc dựa vào các chuỗi suy nghĩ dài và tăng sức mạnh tính toán không còn là một giải pháp hiệu quả cho việc giải quyết các vấn đề AI phức tạp. Những cách tiếp cận này bị giới hạn bởi thời gian xử lý và yêu cầu bộ nhớ khổng lồ.
Tại sao ‘cảm giác trực giác’ quan trọng đối với AI
Không giống như các hệ thống AI hiện tại phụ thuộc vào lý luận mở rộng, con người thường dựa vào cái được gọi là “cảm giác trực giác” (một hình thức phán đoán trực giác nhanh) để giải quyết vấn đề. Mặc dù cảm giác trực giác có thể giống như một khái niệm trừu tượng, nhưng nó thường là kết quả của nhiều năm kinh nghiệm, học tập và xử lý ngữ cảnh cho phép con người đưa ra quyết định nhanh chóng mà không cần phân tích đầy đủ mọi chi tiết. Đó là loại trực giác này phân biệt giữa tính toán thô và suy nghĩ giống con người. Con người xây dựng ‘cảm giác trực giác’ này thông qua việc nhận biết mẫu và tích lũy kinh nghiệm, cho phép chúng ta đưa ra quyết định mà không cần khám phá mọi lựa chọn có thể. Mục tiêu của AI mới là “cảm giác trực giác” nhằm nhân rộng quá trình này.
Cogito v2 đã kết hợp ‘cảm giác trực giác’ như thế nào
Cogito đã kết hợp ý tưởng về ‘cảm giác trực giác’ (còn được gọi là “trước kiến thức thông minh”) vào mô hình Cogito v2 vừa được phát hành. Họ tích hợp ý tưởng này bằng cách sử dụng một cơ chế gọi là Lặp lại và khuếch đại (IDA). Cơ chế này cho phép mô hình học hỏi từ quá trình suy nghĩ của chính nó và tinh chỉnh kỹ năng giải quyết vấn đề theo thời gian. Thay vì dựa vào các gợi ý tĩnh hoặc các giáo viên cố định, IDA cho phép AI chưng cất các đường suy nghĩ thành công trở lại vào các tham số cốt lõi của mô hình. Quá trình tự cải thiện này tinh chỉnh khả năng suy nghĩ của mô hình theo thời gian, tối ưu hóa không chỉ cho các câu trả lời chính xác mà còn cho các phương pháp suy nghĩ hiệu quả nhất.
-
Lặp lại và khuếch đại (IDA)
Để hiểu cách IDA hoạt động, chúng ta có thể xem xét lý thuyết quá trình kép, chia suy nghĩ của con người thành hai hệ thống: Hệ thống 1 và Hệ thống 2. Hệ thống 1 đề cập đến việc ra quyết định trực giác nhanh, trong khi Hệ thống 2 là chậm hơn, với lý luận có chủ ý hơn. Lý thuyết cho rằng con người dựa vào Hệ thống 1 cho hầu hết các nhiệm vụ nhưng chuyển sang Hệ thống 2 khi đối mặt với các quyết định phức tạp hơn.
IDA là một chu kỳ hai bước: khuếch đại và chưng cất. Trong giai đoạn khuếch đại, mô hình sử dụng các phương pháp tính toán chuyên sâu để tạo ra các giải pháp hoặc dấu vết suy nghĩ chất lượng cao. Đây giống như suy nghĩ Hệ thống 2, nơi AI dành thời gian để đánh giá cẩn thận các giải pháp tiềm năng. Trong giai đoạn chưng cất, mô hình sau đó nội hóa các hiểu biết từ giai đoạn khuếch đại, chuyển đổi quá trình suy nghĩ từ Hệ thống 2 sang Hệ thống 1. Giống như một lái xe trở nên trực giác hơn sau khi tích lũy kinh nghiệm, một mô hình AI với IDA có thể đưa ra quyết định nhanh hơn, hiệu quả hơn theo thời gian.
Lợi thế của việc tích hợp ‘cảm giác trực giác’ vào AI
Một trong những lợi thế chính của cảm giác trực giác AI là hiệu quả của nó. Các mô hình như Cogito v2 thể hiện các chuỗi suy nghĩ ngắn hơn tới 60% so với các mô hình cạnh tranh. Điều này có nghĩa là chúng có thể đến với các câu trả lời với ít bước nội bộ hơn, giảm thời gian và tài nguyên cần thiết cho suy luận. Ví dụ, một vấn đề có thể mất hơn 200 token để giải quyết bằng DeepSeek R1 có thể được Cogito v2 hoàn thành trong ít hơn 100 token.
Hơn nữa, chi phí đào tạo Cogito v2 thấp đáng kể so với các mô hình AI truyền thống. Toàn bộ quá trình đào tạo Cogito v2, bao gồm một loạt các tham số, dưới 3,5 triệu đô la, thấp hơn nhiều so với chi phí thường liên quan đến các mô hình quy mô lớn như GPT-4.
Cogito v2 cũng đã thể hiện khả năng nổi bật trong các lĩnh vực mà nó không được đào tạo rõ ràng. Ví dụ, mặc dù được đào tạo chủ yếu trên văn bản, Cogito v2 có thể suy nghĩ về hình ảnh, rút ra những hiểu biết về thành phần và môi trường của hình ảnh. Khả năng suy nghĩ xuyên mô hình này là một bước tiến quan trọng hướng tới trí tuệ nhân tạo tổng quát, một cột mốc quan trọng trên con đường tới Trí tuệ nhân tạo tổng quát (AGI).
Suy nghĩ lại về phát triển AI
Sự thành công của kiến thức thông minh trước cho thấy rằng các chiến lược phát triển AI cần một sự thay đổi cơ bản. Thay vì chỉ tăng kích thước mô hình hoặc tăng tài nguyên tính toán, phát triển AI nên tập trung vào xây dựng các hệ thống có thể phát triển và tinh chỉnh các chiến lược nhận thức của riêng chúng. Sự thay đổi này phản ánh sự phát triển nhận thức của con người, nơi trí thông minh không phải là kết quả của một bộ não lớn hơn hoặc thời gian suy nghĩ nhiều hơn, mà là các mô hình tinh thần và chiến lược suy nghĩ tốt hơn. Sự thay đổi này có thể có những ý nghĩa lâu dài. Bằng cách nhấn mạnh vào suy nghĩ thông minh hơn sức mạnh tính toán thô, AI có thể trở nên đa năng, thích ứng và có khả năng xử lý các thách thức mới. Sự thay đổi này có thể tăng tốc ứng dụng của AI trong các ngành như chăm sóc sức khỏe, an ninh mạng và vận tải tự động, khiến các hệ thống AI trở nên hiệu quả, tiết kiệm chi phí và có tác động hơn.
Kết luận
Sự thành công của Cogito v2 chứng minh rằng tương lai của AI nằm không ở việc tăng kích thước mô hình hoặc tăng sức mạnh tính toán, mà ở việc tinh chỉnh kiến trúc suy nghĩ và tối ưu hóa cho việc giải quyết vấn đề thông minh hơn. Sự thay đổi này hứa hẹn một tương lai bền vững và dễ tiếp cận hơn cho AI, nơi các hệ thống có thể liên tục cải thiện và thích nghi với ít phụ thuộc vào tài nguyên tính toán khổng lồ. Bằng cách tập trung vào suy nghĩ thông minh hơn sức mạnh tính toán thô, AI có thể trở nên có khả năng giải quyết các vấn đề phức tạp, thực tế hơn.












