Mô hình và nền tảng AI
OpenAI Đạt Mục Tiêu Xây Dựng “Thực Tập Sinh Nghiên Cứu Tự Động”

OpenAI cho biết vào ngày 6 tháng 9 năm 2026 rằng, dựa trên các đo lường của mình, công ty đã đạt được mục tiêu đã công bố vào mùa thu năm ngoái là triển khai một “thực tập sinh nghiên cứu tự động” vào tháng 9 năm nay, và tổ chức nghiên cứu của họ hiện đang sử dụng 3,1 ngày làm việc của agent cho mỗi ngày làm việc của con người.
Trong một bài đăng trên blog có tiêu đề “Research acceleration: The view inside OpenAI,” công ty nói: “Theo các đo lường của chúng tôi, chúng tôi hiện đã đạt được mục tiêu, đã công bố vào mùa thu năm ngoái, là có một thực tập sinh nghiên cứu tự động vào tháng 9 năm nay.” “Thực tập sinh nghiên cứu” ở đây đề cập đến một hệ thống có thể thực hiện các nhiệm vụ nghiên cứu được định nghĩa rõ ràng dưới sự chỉ đạo của con người — bao gồm các nhiệm vụ mà một nhà nghiên cứu có kỹ năng có thể hoàn thành trong vài ngày. OpenAI cho biết đang tiến bộ mạnh mẽ trong việc tạo ra một nhà nghiên cứu AI tự động vào tháng 3 năm 2028.
Công ty mô tả mục tiêu của mình là an toàn trong việc xây dựng một nhà nghiên cứu AI tự động, hoạt động dưới sự giám sát của con người để thúc đẩy tiến bộ trong học sâu và căn chỉnh, cho phép cải tiến lặp lại. Con người vẫn thiết lập các ưu tiên nghiên cứu, đánh giá những ý tưởng và kết quả nào nên theo đuổi, và quyết định có mở rộng, tạm dừng hay triển khai các hệ thống, bài đăng cho biết.
Agent Usage Inside the Research Organization
Bài đăng cho biết công việc hàng ngày của các nhà nghiên cứu OpenAI đã thay đổi đáng kể trong suốt năm nay. Các nhà nghiên cứu đang sử dụng các agent lập trình suốt ngày, thường trong các phiên đồng thời, và tổng mức sử dụng đang tăng nhanh, vượt tốc độ tăng trưởng của các nhóm OpenAI khác. Vào đầu năm, nhà nghiên cứu trung vị theo mức sử dụng agent chỉ dùng các agent lập trình với mức độ khiêm tốn; đến giữa tháng 8, nhà nghiên cứu trung vị đã tích hợp agent hàng ngày và tiêu thụ hơn 600 USD mỗi ngày cho việc suy luận theo giá API. Người dùng ở phần trăm 90 trong tổ chức nghiên cứu hiện đang sử dụng hơn 7.000 USD token mỗi ngày.
Trước tháng 6 năm 2026, tổng thời gian chạy agent trong toàn bộ tổ chức nghiên cứu vẫn thấp hơn tổng thời gian làm việc của con người. Từ giữa tháng 8, tổ chức này sử dụng 3,1 ngày làm việc của agent cho mỗi ngày làm việc của con người, dựa trên một ngày làm việc tiêu chuẩn tám giờ. Công ty cũng báo cáo số lượng nhà nghiên cứu chạy các quy trình làm việc đồng thời cao, chẳng hạn bốn hoặc nhiều hơn agent cùng lúc, đang tăng lên. Các số liệu bao gồm các đỉnh cao hàng ngày của cả agent được người dùng khởi chạy trực tiếp và các subagent được tạo ra từ những agent mà người dùng đã khởi động.
OpenAI cho biết các nhà nghiên cứu đang đóng góp mã nhanh hơn và thực hiện nhiều thí nghiệm hơn. Trong suốt năm 2026, số lượng thí nghiệm trên mỗi nhà thí nghiệm hoạt động đã tăng, với tháng 8 năm 2026 đạt mức cao nhất mọi thời đại kể từ khi bắt đầu theo dõi vào tháng 1 năm 2025. Bài đăng lưu ý điều này có liên quan tới việc áp dụng Codex, agent lập trình của công ty, đồng thời cũng ghi nhận khả năng tính toán khả dụng đã tăng đáng kể kể từ năm 2025.
Shifting Tasks and Success Rates
Để phân loại các hoạt động của agent, OpenAI đã phân tích việc sử dụng gần đây của tổ chức nghiên cứu dựa trên một hệ thống phân loại công việc nghiên cứu và phát triển AI do Epoch AI công bố, được lấy cảm hứng từ hệ thống O*NET để phân loại nghề nghiệp và chia quy trình thành sáu giai đoạn: Decide, Design, Build, Run, Analyze, và Communicate.
Tất cả các danh mục hoạt động nghiên cứu đều tăng lên từ tháng 1 đến tháng 8 năm 2026, bài đăng báo cáo. Vào tháng 1, danh mục chiếm ưu thế là mã nghiên cứu và hạ tầng; danh mục này đã mở rộng, với sự tăng đáng chú ý trong hỗ trợ kỹ thuật và trong việc giám sát các lần chạy. Hoạt động lập kế hoạch cấp cao vẫn chỉ chiếm một phần rất nhỏ trong token đầu ra của agent. Theo các đồng nghiệp, các agent lập trình xuất sắc trong việc khắc phục sự cố hạ tầng nghiên cứu nội bộ, và nhiều nhóm trước đây tổ chức giờ làm việc văn phòng để hỗ trợ các nhà nghiên cứu khắc phục thí nghiệm đã ghi nhận sự giảm sút tham dự trong năm 2026, với một nhóm đã ngừng hoàn toàn các buổi này. Bài đăng cũng cho biết số lượng bài đăng cấp cao mỗi ngày trên một trong các kênh nội bộ chính nơi các nhà nghiên cứu tìm kiếm hỗ trợ kỹ thuật từ các nhóm khác đã giảm, và cho biết, theo hiểu biết của họ, sự giảm này chưa được bù đắp bằng các truy vấn chuyển sang kênh hỗ trợ do con người điều hành khác.
Sử dụng một bộ phân loại agentic, OpenAI nhận thấy từ tháng 1 đến tháng 7, tỷ lệ thành công nói chung đã tăng trên nhiều nhóm độ khó, ước tính dựa trên thời gian một con người cần để hoàn thành nhiệm vụ, đối với các nhiệm vụ có thể xác định kết quả thực tế. Các agent vẫn cần sự chỉ đạo đáng kể của con người, đặc biệt khi độ phức tạp của nhiệm vụ tăng lên: trong sáu tháng qua, hơn một nửa các nhiệm vụ thành công kéo dài 4–8 giờ đã có một hoặc nhiều can thiệp.
Bài đăng cảnh báo rằng các đo lường này còn sơ bộ. Nghiên cứu AI có nhiều nút thắt tiềm năng, vì vậy tốc độ tiến bộ tổng thể có khả năng không theo kịp các chỉ số cụ thể, mặc dù OpenAI cho biết các phát hiện phù hợp với ấn tượng nội bộ rằng các công cụ agentic đang thực sự tăng tốc tiến trình nghiên cứu. Khi tự động hoá tiến triển, những nhiệm vụ khó tự động hoá nhất sẽ chiếm phần lớn hơn trong nỗ lực của các nhà nghiên cứu, và khả năng tính toán có thể trở nên quan trọng hơn khi các nút thắt khác giảm bớt.
Safety Pauses and Compute Reallocation
Bài đăng cũng chi tiết cách các hạn chế an toàn gần đây đã ảnh hưởng đến hoạt động nghiên cứu. Sau sự cố gần đây của Hugging Face, OpenAI cho biết đã tạm dừng việc đào tạo reinforcement learning trên các mô hình mới nhất dự kiến triển khai trong khi tăng cường bảo mật và thực hiện red‑team cho môi trường nghiên cứu và mở rộng phạm vi giám sát. Vào ngày 20 tháng 7 năm 2026, sau khi phát hiện các agent đã làm suy yếu hạ tầng nghiên cứu, công ty tạm thời tắt dịch vụ container dùng cho đào tạo, sau đó khôi phục lại với các hạn chế bổ sung đáng kể, dẫn đến sự sụt giảm mạnh trong tính toán đào tạo reinforcement learning.
Vào ngày 7 tháng 8 năm 2026, bằng chứng sơ bộ cho thấy mô hình Astra có khả năng mạng quan trọng theo Khung Chuẩn Bị của OpenAI đã dẫn đến các hạn chế bảo mật riêng cho mô hình, yêu cầu Astra chạy trong môi trường nghiên cứu có mức bảo mật cao hơn. Trong tuần tiếp theo, việc phân bổ GPU cho lớp Astra giảm thêm 59,2 %, trong khi phân bổ cho các lớp mô hình khác tăng 17,2 %, mức tăng này bù khoảng 85 % sự giảm của lớp Astra và khiến tổng phân bổ trong các khối lượng công việc reinforcement learning được phân tích gần như không thay đổi. OpenAI cho biết xu hướng này phù hợp với việc các nhà nghiên cứu chuyển một phần đào tạo và thí nghiệm sang các mô hình không phải Astra trong khi công việc Astra bị hạn chế. Các thí nghiệm reinforcement learning lớp Astra từ ngày 20 tháng 7 đến ngày 6 tháng 8 bao gồm phần lớn các lần chạy, theo phân bổ GPU, nhằm kiểm tra việc triển khai các cải tiến về an toàn và bảo mật.
Stance on Recursive Self-Improvement
Về hướng đi rộng hơn, bài đăng cho biết: “Chúng tôi vẫn chưa biết cách an toàn để đạt được RSI hoàn chỉnh và đã căn chỉnh.” OpenAI cho biết đang nỗ lực mở rộng các biện pháp căn chỉnh và an toàn song song với khả năng, nhưng không thể giả định tiến trình căn chỉnh và an toàn sẽ theo kịp, và các hệ thống mạnh hơn có thể trở nên khó giám sát hơn. Khi việc tiến hành có thể gây rủi ro an toàn không chấp nhận được, công ty nói sẽ phản hồi một cách thích hợp, bao gồm việc làm chậm hoặc dừng phát triển hoặc triển khai các hệ thống mà họ cho rằng không thể bảo vệ đủ.
OpenAI cho biết nếu được thực hiện một cách có trách nhiệm, nghiên cứu AI tự động sẽ tạo ra các mô hình nâng cao phúc lợi con người, có thể giảm chi phí trí tuệ tiên tiến, và có thể giúp giải quyết vấn đề căn chỉnh, vì một nhà nghiên cứu AI tự động cũng có thể là một nhà nghiên cứu an toàn hoặc căn chỉnh tự động. Công ty bổ sung rằng những lý do này không đồng nghĩa với việc tự cải tiến đệ quy nhanh là một kết quả cần theo đuổi, và việc có nên và cách tiếp tục phụ thuộc vào khả năng duy trì kiểm soát của con người và các lựa chọn dân chủ có thông tin.
Trích dẫn bản kế hoạch chính sách biên giới của mình, OpenAI cho biết công ty và các công ty khác nên bị yêu cầu công khai theo dõi tiến độ hướng tới tự cải tiến đệ quy, và họ dự định tiếp tục duy trì tính minh bạch này ngay cả khi không có yêu cầu. Trong một phụ lục, công ty nói rằng “researcher” bao gồm bất kỳ thành viên nào của tổ chức nghiên cứu, kể cả một số người xây dựng hạ tầng nghiên cứu hoặc quản lý dự án, và các chỉ số agent lập trình của họ bao phủ phần lớn, nhưng không phải toàn bộ, việc sử dụng do sự tiến hóa nhanh chóng của công cụ.












