Mô hình và nền tảng AI
Trình độ trí tuệ nhân tạo Tülu 3 của Allen AI vừa trở thành đối thủ không ngờ của DeepSeek

Những tiêu đề vẫn tiếp tục đến. Các mô hình của DeepSeek đã thách thức các chuẩn mực, thiết lập các tiêu chuẩn mới và gây ra rất nhiều tiếng vang. Nhưng điều gì đó thú vị vừa xảy ra trong lĩnh vực nghiên cứu trí tuệ nhân tạo mà cũng đáng được chú ý.
Allen AI đã im lặng phát hành dòng mô hình Tülu 3 mới của họ, và phiên bản 405B parameter của nó không chỉ cạnh tranh với DeepSeek – mà còn匹 hoặc vượt qua nó trên các chuẩn mực chính.
Hãy đặt điều này vào перспектива.
Mô hình Tülu 3 405B đang đối đầu với các mô hình hàng đầu như DeepSeek V3 trên nhiều nhiệm vụ. Chúng tôi đang thấy hiệu suất tương đương hoặc vượt trội trong các lĩnh vực như giải toán, thử thách mã hóa và tuân theo hướng dẫn chính xác. Và họ cũng làm điều này với một cách tiếp cận hoàn toàn mở.
Họ đã phát hành toàn bộ đường ống đào tạo, mã và thậm chí phương pháp học tăng cường mới gọi là Học tăng cường với Phần thưởng Xác thực (RLVR) mà đã làm cho điều này trở nên khả thi.
Các phát triển như những này trong vài tuần qua thực sự đang thay đổi cách phát triển trí tuệ nhân tạo hàng đầu xảy ra. Khi một mô hình mã nguồn mở hoàn toàn có thể匹 hoặc vượt qua các mô hình đóng tốt nhất, nó mở ra những khả năng trước đây bị khóa sau những bức tường công ty riêng tư.
Cuộc Chiến Thuật Toán
Điều gì đã làm cho Tülu 3 nổi bật? Nó đến từ một quá trình đào tạo bốn giai đoạn độc đáo vượt qua các phương pháp truyền thống.
Hãy cùng nhìn vào cách Allen AI xây dựng mô hình này:
Giai đoạn 1: Lựa Chọn Dữ Liệu Chiến Lược
Đội ngũ biết rằng chất lượng mô hình bắt đầu từ chất lượng dữ liệu. Họ kết hợp các tập dữ liệu đã thành lập như WildChat và Trợ lý Mở với nội dung được tạo tự động. Nhưng đây là cái nhìn sâu sắc chính: họ không chỉ tổng hợp dữ liệu – họ tạo ra các tập dữ liệu được nhắm mục tiêu cho các kỹ năng cụ thể như lý luận toán học và thành thạo mã hóa.
Giai đoạn 2: Xây Dựng Câu Trả Lời Tốt Hơn
Trong giai đoạn thứ hai, Allen AI tập trung vào việc dạy mô hình của họ các kỹ năng cụ thể. Họ tạo ra các tập dữ liệu đào tạo khác nhau – một số cho toán, những cái khác cho mã hóa và nhiều hơn cho các nhiệm vụ chung. Bằng cách thử nghiệm các kết hợp này lặp đi lặp lại, họ có thể thấy chính xác nơi mô hình vượt trội và nơi nó cần cải thiện. Quá trình lặp lại này tiết lộ tiềm năng thực sự của những gì Tülu 3 có thể đạt được trong từng lĩnh vực.
Giai đoạn 3: Học Từ So Sánh
Đây là nơi Allen AI trở nên sáng tạo. Họ xây dựng một hệ thống có thể so sánh tức thời các câu trả lời của Tülu 3 với các mô hình hàng đầu khác. Nhưng họ cũng giải quyết một vấn đề dai dẳng trong AI – xu hướng của các mô hình viết các câu trả lời dài chỉ vì độ dài. Phương pháp của họ, sử dụng Tối ưu hóa Ưu tiên Trực tiếp (DPO) chuẩn hóa độ dài, có nghĩa là mô hình học cách đánh giá cao chất lượng hơn số lượng. Kết quả? Các câu trả lời chính xác và có mục đích.
Khi các mô hình AI học từ sở thích (câu trả lời nào tốt hơn, A hay B?), chúng có xu hướng phát triển một thiên vị khó chịu: chúng bắt đầu nghĩ rằng các câu trả lời dài hơn luôn tốt hơn. Giống như chúng đang cố gắng giành chiến thắng bằng cách nói nhiều hơn chứ không phải nói tốt.
Tối ưu hóa Ưu tiên Trực tiếp chuẩn hóa độ dài sửa chữa điều này bằng cách điều chỉnh cách mô hình học từ sở thích. Thay vì chỉ xem xét câu trả lời nào được ưa thích, nó tính đến độ dài của mỗi câu trả lời. Hãy nghĩ về nó như đánh giá các câu trả lời theo chất lượng mỗi từ, không chỉ tác động tổng thể.
Tại sao điều này lại quan trọng? Bởi vì nó giúp Tülu 3 học cách chính xác và hiệu quả. Thay vì lấp đầy các câu trả lời với các từ phụ để có vẻ toàn diện hơn, nó học cách cung cấp giá trị trong bất kỳ độ dài nào thực sự cần thiết.
Điều này có thể看似 một chi tiết nhỏ, nhưng nó rất quan trọng để xây dựng AI giao tiếp tự nhiên. Các chuyên gia hàng đầu biết khi nào nên cô đọng và khi nào nên mở rộng – và chính xác điều đó mà Tối ưu hóa Ưu tiên Trực tiếp chuẩn hóa độ dài giúp dạy cho mô hình.
Giai đoạn 4: Đổi Mới RLVR
Đây là đột phá kỹ thuật xứng đáng được chú ý. RLVR thay thế các mô hình phần thưởng chủ quan bằng xác thực cụ thể.
Hầu hết các mô hình AI học thông qua một hệ thống phức tạp của các mô hình phần thưởng – cơ bản là các ước tính có giáo dục về những gì làm cho một câu trả lời tốt. Nhưng Allen AI đã đi theo một con đường khác với RLVR.
Hãy nghĩ về cách chúng ta hiện tại đào tạo các mô hình AI. Chúng tôi thường cần các mô hình AI khác (gọi là mô hình phần thưởng) để đánh giá xem một câu trả lời có tốt hay không. Nó chủ quan, phức tạp và thường không nhất quán. Một số câu trả lời có thể看似 tốt nhưng chứa các lỗi tinh vi trượt qua.
RLVR lật ngược cách tiếp cận này. Thay vì dựa vào các phán đoán chủ quan, nó sử dụng các kết quả cụ thể, xác thực. Khi mô hình cố gắng giải một vấn đề toán, không có vùng xám – câu trả lời là đúng hoặc sai. Khi nó viết mã, mã đó chạy chính xác hoặc không.
Đây là nơi nó trở nên thú vị:
- Mô hình nhận được phản hồi tức thời, nhị phân: 10 điểm cho các câu trả lời chính xác, 0 cho các câu trả lời không chính xác
- Không có chỗ cho điểm tín dụng một phần hoặc đánh giá mờ
- Quá trình học tập trở nên tập trung và chính xác
- Mô hình học cách ưu tiên độ chính xác hơn các câu trả lời nghe có vẻ hợp lý nhưng không chính xác

RLVR Training (Allen AI)
Kết quả? Tülu 3 đã cho thấy sự cải thiện đáng kể trong các nhiệm vụ mà độ chính xác quan trọng nhất. Hiệu suất của nó trong lý luận toán học (chuẩn mực GSM8K) và thử thách mã hóa đã tăng đáng kể. Thậm chí khả năng tuân theo hướng dẫn của nó cũng trở nên chính xác hơn vì mô hình học cách đánh giá cao độ chính xác cụ thể hơn các câu trả lời gần đúng.
Điều làm cho điều này đặc biệt thú vị là cách nó thay đổi trò chơi cho AI mã nguồn mở. Các phương pháp trước đây thường gặp khó khăn trong việc匹 hoặc vượt qua các mô hình đóng trên các nhiệm vụ kỹ thuật. RLVR cho thấy rằng với cách tiếp cận đào tạo phù hợp, các mô hình mã nguồn mở có thể đạt được mức độ tin cậy tương tự.
Nhìn Vào Số Liệu
Phiên bản 405B parameter của Tülu 3 cạnh tranh trực tiếp với các mô hình hàng đầu trong lĩnh vực. Hãy cùng xem nơi nó vượt trội và điều này có nghĩa gì cho AI mã nguồn mở.
Toán Học
Tülu 3 vượt trội trong lý luận toán học phức tạp. Trên các chuẩn mực như GSM8K và MATH, nó匹 hoặc vượt qua hiệu suất của DeepSeek. Mô hình xử lý các vấn đề nhiều bước và thể hiện khả năng lý luận toán học mạnh mẽ.
Mã Hóa
Kết quả mã hóa cũng chứng minh sự ấn tượng tương đương. Nhờ vào đào tạo RLVR, Tülu 3 viết mã giải quyết vấn đề hiệu quả. Điểm mạnh của nó nằm ở việc hiểu các hướng dẫn mã hóa và tạo ra các giải pháp chức năng.
Tuân Theo Hướng Dẫn Chính Xác
Khả năng của mô hình trong việc tuân theo hướng dẫn nổi bật như một điểm mạnh cốt lõi. Trong khi nhiều mô hình gần đúng hoặc tổng quát hóa các hướng dẫn, Tülu 3 chứng minh sự chính xác đáng chú ý trong việc thực hiện chính xác những gì được yêu cầu.
Mở Hộp Đen Của Phát Triển Trí Tuệ Nhân Tạo
Allen AI đã phát hành cả một mô hình mạnh mẽ và toàn bộ quá trình phát triển của họ.
Mọi khía cạnh của quá trình đào tạo đều được ghi chép và có sẵn. Từ cách tiếp cận bốn giai đoạn đến các phương pháp chuẩn bị dữ liệu và triển khai RLVR – toàn bộ quá trình nằm mở để nghiên cứu và sao chép. Sự minh bạch này thiết lập một tiêu chuẩn mới trong phát triển trí tuệ nhân tạo hiệu suất cao.
Các nhà phát triển nhận được các tài nguyên toàn diện:
- Toàn bộ đường ống đào tạo
- Công cụ xử lý dữ liệu
- Khung đánh giá
- Các thông số kỹ thuật triển khai
Điều này cho phép các nhóm:
- Sửa đổi các quá trình đào tạo
- Thích ứng các phương pháp cho các nhu cầu cụ thể
- Xây dựng trên các phương pháp đã được chứng minh
- Tạo ra các triển khai chuyên dụng
Cách tiếp cận mở này tăng tốc đổi mới trên toàn lĩnh vực. Các nhà nghiên cứu có thể xây dựng trên các phương pháp đã được xác minh, trong khi các nhà phát triển có thể tập trung vào cải tiến thay vì bắt đầu từ đầu.
Sự Trỗi Dậy Của Sự Xuất Sắc Mã Nguồn Mở
Sự thành công của Tülu 3 là một khoảnh khắc lớn cho sự phát triển AI mã nguồn mở. Khi các mô hình mã nguồn mở匹 hoặc vượt qua các giải pháp riêng tư, nó thay đổi cơ bản ngành công nghiệp. Các nhóm nghiên cứu trên toàn thế giới có quyền truy cập vào các phương pháp đã được chứng minh, tăng tốc công việc của họ và tạo ra những đổi mới mới. Các phòng thí nghiệm AI riêng tư sẽ cần phải thích nghi – hoặc bằng cách tăng cường minh bạch hoặc đẩy ranh giới kỹ thuật thậm chí còn xa hơn.
Nhìn về phía trước, những đột phá của Tülu 3 trong phần thưởng xác thực và đào tạo nhiều giai đoạn gợi ý về những gì đang đến. Các nhóm có thể xây dựng trên những nền tảng này, có khả năng đẩy hiệu suất thậm chí còn cao hơn. Mã tồn tại, các phương pháp được ghi chép và một làn sóng phát triển AI mới đã bắt đầu. Đối với các nhà phát triển và nhà nghiên cứu, cơ hội để thử nghiệm và cải tiến các phương pháp này đánh dấu sự bắt đầu của một chương thú vị trong phát triển AI.
Câu Hỏi Thường Gặp (FAQ) Về Tülu 3
Tülu 3 Là Gì Và Những Tính Năng Chính Của Nó?
Tülu 3 là một dòng mô hình ngôn ngữ lớn mã nguồn mở được phát triển bởi Allen AI, được xây dựng trên kiến trúc Llama 3.1. Nó có sẵn trong các kích cỡ khác nhau (8B, 70B và 405B tham số). Tülu 3 được thiết kế để cải thiện hiệu suất trên nhiều nhiệm vụ khác nhau, bao gồm kiến thức, lý luận, toán, mã hóa, tuân theo hướng dẫn và an toàn.
Quá Trình Đào Tạo Của Tülu 3 Là Gì Và Dữ Liệu Nào Được Sử Dụng?
Đào tạo Tülu 3 bao gồm nhiều giai đoạn chính. Đầu tiên, đội ngũ thu thập một tập hợp đa dạng các câu hỏi từ cả dữ liệu công khai và dữ liệu tổng hợp nhắm vào các kỹ năng cụ thể, đảm bảo dữ liệu được làm sạch khỏi các chuẩn mực. Thứ hai, đào tạo tinh chỉnh có giám sát (SFT) được thực hiện trên một hỗn hợp của dữ liệu tuân theo hướng dẫn, toán và mã hóa. Tiếp theo, tối ưu hóa ưu tiên trực tiếp (DPO) được sử dụng với dữ liệu ưu tiên được tạo ra thông qua phản hồi của con người và mô hình ngôn ngữ lớn. Cuối cùng, học tăng cường với phần thưởng xác thực (RLVR) được sử dụng cho các nhiệm vụ có độ chính xác có thể đo lường. Tülu 3 sử dụng các tập dữ liệu được tạo riêng cho từng giai đoạn, bao gồm hướng dẫn được điều khiển bởi người dùng, toán và dữ liệu mã hóa.
Tülu 3 Tiếp Cận An Toàn Như Thế Nào Và Những Chỉ Số Nào Được Sử Dụng Để Đánh Giá Nó?
An toàn là một thành phần cốt lõi trong quá trình phát triển Tülu 3, được giải quyết trong suốt quá trình đào tạo. Một tập dữ liệu an toàn cụ thể được sử dụng trong quá trình SFT, được tìm thấy là hầu như trực giao với các dữ liệu định hướng nhiệm vụ khác.
RLVR Là Gì?
RLVR là một kỹ thuật trong đó mô hình được đào tạo để tối ưu hóa chống lại một phần thưởng xác thực, như độ chính xác của một câu trả lời. Điều này khác với học tăng cường truyền thống với phần thưởng từ mô hình (RLHF), sử dụng mô hình phần thưởng.













