Mô hình và nền tảng AI

SpaceXAI phát hành Grok 4.7 cho lập trình và công việc tri thức

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

SpaceXAI vào ngày 21 tháng 9 năm 2026 đã phát hành Grok 4.7, mô hình mới nhất của mình cho lập trình và công việc tri thức, với giá từ $2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra.

Trong thông báo phát hành, SpaceXAI mô tả Grok 4.7 là mô hình có khả năng nhất của mình cho lập trình và công việc tri thức, cho biết nó làm việc lâu hơn trên các nhiệm vụ khó và kiểm tra công việc của mình một cách cẩn thận hơn. Công ty cho biết mô hình này có các biện pháp bảo vệ được hiệu chỉnh tốt nhất cho đến nay, được cung cấp với cùng mức giá và tốc độ như tiền kế, Grok 4.6, và nhanh gấp đôi với giá một nửa so với các mô hình tương đương.

Mô hình nền tảng lớn hơn, quá trình huấn luyện dài hơn

Theo thông báo, Grok 4.7 sử dụng một mô hình nền tảng mới, lớn hơn so với Grok 4.6 và được huấn luyện bằng một chu kỳ học tăng cường dài hơn trên một tập hợp nhiệm vụ khó hơn, tập trung vào các vấn đề mất nhiều giờ để hoàn thành. SpaceXAI cho biết mô hình thu được tốt hơn trong việc xác minh công việc của mình và quản lý ngữ cảnh dài hơn.

Công ty cũng cho biết họ đã huấn luyện Grok 4.7 để hiểu một cách tự nhiên bộ khung Grok Bot, giúp nó tốt hơn trong các nhiệm vụ đối thoại và công việc tri thức chung. SpaceXAI đã giới thiệu Grok Bot vào ngày 11 tháng 8 năm 2026, mô tả nó như một đội ngũ các tác nhân luôn hoạt động có máy tính riêng, làm việc bên trong các công cụ và ứng dụng, và làm việc liên tục suốt ngày đêm. Ngoài ra, công ty cho biết Grok 4.7 tốt hơn trong việc tạo tài liệu và bản trình bày.

Grok 4.7 kế thừa Grok 4.6, mà SpaceXAI được công bố vào ngày 12 tháng 8 năm 2026, mô tả nó như là sự tiếp nối của Grok 4.5 với trọng tâm đặc biệt vào các tác nhân chạy lâu và công việc tương tác và trực quan đầy tham vọng hơn. Sau đó vào tháng 8 năm 2026, công ty đã mở rộng Grok 4.6 sang GitHub Copilot, Amazon Bedrock, Gemini Enterprise Agent Platform và Microsoft Foundry, theo các danh sách có ngày trong kho tin tức của mình.

Các điểm chuẩn đã báo cáo

SpaceXAI đã công bố một bảng chuẩn và bảng giá so sánh Grok 4.7 với Grok 4.6, GPT-5.6 Sol và Fable 5.1. Trong bảng, Grok 4.7 được liệt kê ở mức nỗ lực có nhãn xhigh, Grok 4.6 ở mức high, và GPT-5.6 Sol cùng Fable 5.1 ở mức max.

Trong CursorBench 4.0, mà SpaceXAI cho biết tập trung vào các nhiệm vụ lập trình kéo dài, công ty báo cáo Grok 4.7 đạt 46.3%, so với 40.4% của Grok 4.6, 41.7% của GPT-5.6 Sol và 51.8% của Fable 5.1. SpaceXAI cho rằng Grok 4.7 nằm ở vị trí tiên phong về hiệu suất giá trên chuẩn này.

Đối với DeepSWE v1.1, một đánh giá kỹ thuật phần mềm, SpaceXAI báo cáo 71.0% cho Grok 4.7 ở mức nỗ lực cao, so sánh với 65.2% cho Grok 4.6, 72.7% cho GPT-5.6 Sol và 70.0% cho Fable 5.1. Trong Terminal-Bench 4.0, mà bao phủ công việc terminal kéo dài nhiều giờ, các số liệu báo cáo là 38.0% cho Grok 4.7, 20.3% cho Grok 4.6, 37.3% cho GPT-5.6 Sol và 57.9% cho Fable 5.1.

Trong AA Briefcase v1.1, đo lường công việc văn phòng kéo dài nhiều giờ, các điểm số báo cáo là 1,657 cho Grok 4.7, 1,546 cho Grok 4.6, 1,487 cho GPT-5.6 Sol và 1,678 cho Fable 5.1. SpaceXAI báo cáo 19.6% cho Grok 4.7 trên tiêu chuẩn Harvey Legal Agent Benchmark, so với 15.8% cho Grok 4.6, 2.5% cho GPT-5.6 Sol và 6.7% cho Fable 5.1. Trong HealthBench Professional, một đánh giá lý luận lâm sàng, các số liệu báo cáo là 56.7% cho Grok 4.7, 48.5% cho Grok 4.6, 60.5% cho GPT-5.6 Sol và 62.1% cho Fable 5.1. Trong EEBench, bao phủ kỹ thuật điện, công ty báo cáo 64.0% cho Grok 4.7, 53.0% cho Grok 4.6, 39.4% cho GPT-5.6 Sol và 56.4% cho Fable 5.1.

Một biểu đồ GDPval riêng báo cáo điểm Elo là 1,735 cho Fable 5.1 ở mức nỗ lực tối đa, 1,695 cho Grok 4.7, 1,605 cho Grok 4.6 và 1,542 cho GPT-6 Astra ở mức nỗ lực tối đa. SpaceXAI cho biết GDPval và AA Briefcase yêu cầu các mô hình AI thực hiện các nhiệm vụ của các chuyên gia như luật sư, y tá và nhà phân tích tài chính, và rằng Grok 4.7 cải thiện so với Grok 4.6 trên cả hai tiêu chuẩn trong khi đạt hiệu năng tương đương với các mô hình tiên phong khác.

Bảng cũng liệt kê giá token: $2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra cho Grok 4.7 và Grok 4.6, $4 và $20 cho GPT-5.6 Sol, và $10 và $50 cho Fable 5.1.

Biện pháp bảo vệ và An ninh mạng

SpaceXAI cho biết Grok 4.7 được xây dựng với một lớp bảo vệ hoàn toàn mới và là mô hình mạnh nhất mà công ty đã thử nghiệm về việc từ chối và khả năng chống jailbreak. Trong các lĩnh vực sử dụng kép như an ninh mạng và công việc sinh học, công ty cho rằng Grok 4.7 dẫn đầu cả về tiện ích cho các nhiệm vụ lành tính và khả năng từ chối an toàn các nhiệm vụ nguy hiểm, đạt mức cao nhất trên tiêu chuẩn an toàn sinh học của LatchBio với 62.4%.

Trong HackerBench v0.3, mà SpaceXAI mô tả là tiêu chuẩn riêng của mình cho các nhiệm vụ mạng nguy hiểm và độc hại, công ty cho biết Grok 4.7 chỉ cho phép 3.3% các lời nhắc sử dụng kép nguy hiểm đi qua trong khi hiếm khi chặn công việc bảo mật hợp pháp. SpaceXAI cho biết họ cũng đã bắt đầu cung cấp cho một số đối tác an ninh mạng quyền truy cập chỉ bằng lời mời vào các khả năng red-team của Grok 4.7 cho nghiên cứu phòng thủ.

LatchBio trước đây đã đánh giá Grok 4.6 trên việc giám sát an ninh sinh học và các nhiệm vụ sinh học đối kháng, theo một bài đăng ngày 1 tháng 9 năm 2026 trong kho tin tức của công ty, trong đó cho biết mô hình trước đó phát hiện và từ chối các truy vấn nguy hiểm một cách đáng tin cậy hơn bất kỳ hệ thống tiên phong nào khác.

Giá và khả dụng

Grok 4.7 sẽ có sẵn bắt đầu từ ngày 21 tháng 9 năm 2026 trong Cursor và trong Grok Build, tác vụ lập trình của SpaceXAI, cũng như qua Grok API, các công cụ lập trình của bên thứ ba, và các bộ định tuyến mô hình cùng các nền tảng đám mây.

Bên cạnh mức giá tiêu chuẩn, SpaceXAI cung cấp một phiên bản nhanh của Grok 4.7 với tốc độ đầu ra gấp đôi và giá gấp đôi. Công ty cũng đang cung cấp quyền truy cập miễn phí vào mô hình trong Grok Build tại x.ai/build.

Jonas Reeve là một nhà phân tích được tạo bởi AI tại Unite.AI, tập trung vào trí tuệ nhân tạo nhận thức, trí tuệ nhân tạo tổng quát (AGI) và các nền tảng lý thuyết của trí tuệ máy. Công việc của ông khám phá cách học tập, lý luận, trí nhớ và trừu tượng hóa xuất hiện trong cả hệ thống sinh học và nhân tạo, vẽ ra các kết nối giữa các kiến trúc AI hiện đại và các câu hỏi lâu đời trong khoa học nhận thức và triết lý của tâm trí.
Với một cách tiếp cận khái niệm và phản ánh, Jonas kiểm tra các khuôn khổ như mô hình lý luận, hệ thống đại lý, nhận thức xuất hiện và lý thuyết liên kết, nhằm làm rõ tiến bộ hướng tới AGI thực sự có nghĩa là gì - và những gì nó không có. Thay vì theo đuổi thời gian hoặc sự cường điệu, ông nhấn mạnh các nguyên tắc cơ bản, sự nghiêm ngặt về khái niệm và giới hạn của các mô hình hiện tại.
Các bài viết được viết bởi Jonas Reeve được tạo bởi AI và được xem xét bởi đội ngũ biên tập của Unite.AI để đảm bảo độ chính xác, sự rõ ràng và thảo luận có trách nhiệm về các khái niệm AI tiên tiến.