Mô hình và nền tảng AI

Google công bố mô hình biên giới Gemini 4 Argon cho lập trình, phòng thủ mạng

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Google đã công bố Gemini 4 Argon vào ngày 30 tháng 9 năm 2026, mô tả nó là mô hình biên giới mới của công ty dành cho kỹ thuật phần mềm thực tế, công việc tri thức doanh nghiệp như pháp lý và tài chính, và phòng thủ an ninh mạng. Mô hình này sẽ được triển khai đầu tiên cho các nhà phòng thủ mạng đáng tin cậy thông qua Chương trình Fairwind của Google, với mức giá giới thiệu là 2 USD cho mỗi triệu token đầu vào.

Trong một bài đăng trên The Keyword, Koray Kavukcuoglu, Phó Chủ tịch cấp cao của Google DeepMind và Kiến trúc sư AI trưởng tại Google, cho biết việc phát hành an toàn các khả năng biên giới ở mức này đòi hỏi một phương pháp có giai đoạn. Google đang tích cực tham gia vào quy trình tự nguyện của chính phủ Hoa Kỳ để truy cập mô hình trước khi phát hành trong khi dần mở rộng quyền truy cập, và cho biết sẽ tiếp tục thu thập phản hồi từ những người thử nghiệm sớm khi cải tiến các biện pháp kiểm soát.

Giá giới thiệu của Argon là 2 USD cho mỗi triệu token đầu vào và 10 USD cho mỗi triệu token đầu ra, với token đầu vào được lưu trong bộ nhớ đệm được giảm 95% so với giá token đầu vào. Một chú thích trong thông báo cho biết sau khi thời gian giới thiệu kết thúc, giá sẽ là 4 USD cho mỗi triệu token đầu vào và 20 USD cho mỗi triệu token đầu ra.

Triển khai nội bộ và mở rộng giới hạn token đầu ra

Google cho biết Argon đã và đang hỗ trợ các quy trình nội bộ, với hàng ngàn nhân viên nhấn mạnh điểm mạnh của mô hình trong các nhiệm vụ lập trình chuyên biệt, thực hiện nghiên cứu sâu hơn và viết chất lượng. Công ty đã báo cáo một số ví dụ từ việc triển khai đó. Argon đang giúp các nhà nghiên cứu máy tính lượng tử của Google tối ưu hóa tài nguyên không‑thời gian (qubits × gates) của các tiểu chương gây tắc nghẽn các ứng dụng quan trọng; trong một ví dụ, nó đã vượt qua mức chuẩn đã công bố tới 40% chỉ trong vài phút. Một đội ngũ các đại lý Argon đã phân tích dữ liệu đo lường toàn bộ hệ thống để tự động xác định và áp dụng các tối ưu hóa bộ nhớ trên các trung tâm dữ liệu của Google, giải phóng hơn 300 TiB bộ nhớ sau khi triển khai, với ước tính tổng mức tiết kiệm từ 500 TiB đến 1 PiB.

Google cho biết các đại lý Argon cũng đang chuyển đổi các cơ sở mã C/C++ sang Rust trên toàn công ty, mở rộng từ hàng chục nghìn dòng trong các thư viện lõi như re2 và libgav1 lên hơn 800 nghìn dòng cho nhân kernel Zircon của hệ điều hành Fuchsia. Do tính quan trọng của nhiều hệ thống này, các việc viết lại quy mô lớn đang trải qua quá trình kiểm toán tự động và thủ công nghiêm ngặt, thử nghiệm mô phỏng và đánh giá trước khi triển khai vào môi trường sản xuất.

Đối với libgav1, phần mềm mã nguồn mở của Google để giải mã video, các đại lý Argon đã lấy một bản chuyển đổi Rust hiện có và thay thế 32.000 dòng mã SIMD bằng cách thực hiện các vòng thí nghiệm dựa trên hồ sơ và nghiên cứu kết quả của trình biên dịch. Google cho biết kết quả là một bộ giải mã video an toàn về bộ nhớ, chạy nhanh hơn bản Rust tới 2,7 lần, với đầu ra video giống hệt.

Để hỗ trợ các trường hợp sử dụng dài hơn và phức tạp hơn, Google đã mở rộng giới hạn token đầu ra của mô hình lên 1 triệu token, tăng so với 64 nghìn token trước đây, một con số mà công ty mô tả là dẫn đầu ngành.

Tiêu chuẩn doanh nghiệp và phòng thủ an ninh mạng

Google báo cáo rằng Argon đạt mức mới nhất trên DeepSWE v1.1 với điểm số 77,9%, một chuẩn đo lường hiệu suất trên các nhiệm vụ kỹ thuật phần mềm dài hạn trong thực tế. Công ty mô tả Argon là mô hình dẫn đầu trên Chỉ số Vals, đo lường tác động kinh tế trên các lĩnh vực tài chính, lập trình, pháp lý và thuế, với mỗi ngành được cân nhắc theo đóng góp vào GDP của Hoa Kỳ, và cũng báo cáo hiệu suất dẫn đầu tương tự trên Vals Finance Agent v2 cho nghiên cứu tài chính đa bước và Chuẩn đo lường Legal Agent của Harvey cho nghiên cứu và soạn thảo pháp lý.

Trong AutomationBench, chuẩn đo lường của Zapier về thực thi đầu‑cuối trên các chức năng kinh doanh cốt lõi, Google báo cáo Argon đứng đầu với điểm số 51,3%. Trong LVBench, đo lường khả năng hiểu video dài, công ty báo cáo điểm số tiên tiến 91,7%, và cho biết Argon có thể thực hiện phân tích biểu đồ chuyên nghiệp, nhận diện chi tiết từ video dài, và thực hiện hành động dựa trên một loạt tài liệu.

Google cho biết đã đào tạo Argon để tự động tìm kiếm, xác thực và vá các lỗ hổng phần mềm quan trọng, và sẽ phát hành mô hình này mà không có các biện pháp kiểm soát an ninh mạng cho các nhà phòng thủ đáng tin cậy và các đội nội bộ của mình. Wiz đã sử dụng Argon thông qua sáng kiến Scan for Good, một chương trình dành riêng để bảo vệ cơ sở hạ tầng công cộng quan trọng miễn phí bằng cách tìm và khắc phục các rủi ro cao. Google cho biết mô hình đã phát hiện một lỗ hổng nghiêm trọng làm lộ thông tin cá nhân nhạy cảm trong phần mềm chăm sóc sức khỏe được các bệnh viện trên toàn thế giới sử dụng, xác định một rủi ro nghiêm trọng mà các mô hình biên giới trước đây đã bỏ lỡ.

Trong CWE‑bench v1, đánh giá khả năng của mô hình trong việc khắc phục các lỗ hổng bảo mật, Google báo cáo Argon giành vị trí đồng nhất nhất với điểm số cao nhất 68%. Công ty cho biết Argon cũng đã phát hiện các rủi ro trên các cơ sở mã phức tạp bao gồm 20 ngôn ngữ lập trình trong chuẩn đo lường lỗ hổng nội bộ, và vượt trội hơn Gemini 3.8 Flash Cyber trên chuẩn đo lường kiểm thử thâm nhập hộp đen nội bộ của Wiz, kiểm tra khả năng của mô hình trong việc phân tích các hệ thống web trực tiếp mà không có mã nguồn.

Chương trình Fairwind Program, được Google ra mắt vào ngày 2 tháng 9 năm 2026, là một chương trình truy cập hạn chế dành cho các chính phủ và đối tác đáng tin cậy để sử dụng các công cụ phòng thủ mạng của công ty. Các tổ chức tham gia đồng ý với các tiêu chuẩn vận hành, bao gồm việc hạn chế quyền truy cập của nhân viên trong các nhóm bảo mật nội bộ, phản ứng sự cố hoặc kiểm thử xâm nhập và triển khai các biện pháp bảo vệ như xác thực đa yếu tố. Google cho biết chương trình có hơn 650 đối tác tham gia trên toàn cầu, và đề xuất đầu tiên của nó kết hợp Gemini 3.8 Flash Cyber với bộ công cụ CodeMender để giúp các nhà phòng thủ tìm, xác minh và khắc phục các lỗ hổng.

Frontier Safeguards và Triển khai Giai đoạn

Google cho biết họ đang củng cố Frontier Safeguards ở bốn lĩnh vực trước khi Argon được triển khai rộng rãi. Đối với phòng thủ lạm dụng, mô hình được thiết kế để từ chối các yêu cầu gây hại về mạng và các yêu cầu về hoá học, sinh học, phóng xạ và hạt nhân, đồng thời bảo vệ các nghiên cứu khoa học hợp pháp có tính hai mục đích theo Google’s Frontier Safety Framework. Công ty cho biết họ đang cải thiện các kỹ thuật giám sát các kích hoạt nội bộ của mô hình để phát hiện lạm dụng, và các biện pháp bảo vệ đã được kiểm tra độ bền vững bởi các đội đỏ nội bộ và bên ngoài sử dụng các phương pháp tấn công thủ công và tự động.

Google mô tả Argon là mô hình chịu đựng nhất của họ cho đến nay đối với tấn công chèn lời nhắc gián tiếp, trong đó các chỉ thị hoặc ngữ cảnh độc hại được sử dụng để chiếm đoạt hành vi của mô hình, và cho biết đạt độ bền vững hàng đầu trên tiêu chuẩn Indirect Prompt Injection của Gray Swan thông qua các hoạt động red teaming tự động và đào tạo đối kháng.

Công ty cũng đang triển khai các biện pháp giảm lệch hướng, giám sát chuỗi suy nghĩ và hành động của Argon và dừng thực thi khi cần thiết. Google cho biết một hệ thống tương tự đã giám sát các lần đào tạo của họ và gửi cảnh báo tới đội phản hồi sự cố chuyên dụng, với các biện pháp phòng ngừa cẩn thận để không đưa các phát hiện trở lại quá trình đào tạo. Cuối cùng, Google cho biết họ đang tăng cường độ bền cho các môi trường sandbox bằng cách cô lập và niêm phong chúng trước khi bắt đầu các buổi đào tạo hoặc đánh giá có rủi ro cao, phù hợp với agent control roadmap của họ.

Google cho biết phản hồi từ nhóm ban đầu của các nhà phòng thủ mạng và các nhà kiểm thử đáng tin cậy sẽ giúp họ củng cố hệ thống trước khi Argon được phát hành cho các nhà phát triển, doanh nghiệp và người tiêu dùng, bắt đầu với khách hàng API trả phí và người đăng ký Google AI Ultra, càng sớm càng tốt.

Jonas Reeve là một nhà phân tích được tạo ra bằng AI tại Unite.AI, tập trung vào AI nhận thức, trí tuệ nhân tạo chung (AGI), và các nền tảng lý thuyết của trí thông minh máy móc. Công việc của ông khám phá cách mà học tập, suy luận, trí nhớ và trừu tượng xuất hiện trong cả hệ thống sinh học và nhân tạo, tạo ra các mối liên kết giữa kiến trúc AI hiện đại và những câu hỏi lâu đời trong khoa học nhận thức và triết học tâm trí.

Với cách tiếp cận khái niệm và suy ngẫm, Jonas xem xét các khung như mô hình suy luận, hệ thống đại lý, nhận thức nổi lên, và lý thuyết cân chỉnh, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì — và không phải là gì. Thay vì chạy theo các thời gian biểu hay sự thổi phồng, ông nhấn mạnh các nguyên tắc nền tảng, tính chặt chẽ khái niệm, và giới hạn của các mô hình hiện tại.

Các bài viết do Jonas Reeve viết được tạo ra bằng AI và được đội ngũ biên tập của Unite.AI xem xét để đảm bảo độ chính xác, rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.