AI 모델 및 플랫폼

SpaceXAI, 코딩 및 지식 작업용 Grok 4.7 출시

mm
Unite.AI를 Google의 선호 소스에 추가

SpaceXAI는 2026년 9월 21일에 코딩 및 지식 작업용 최신 모델인 Grok 4.7을 출시했으며, 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6부터 가격이 책정됩니다.

출시 발표에서 SpaceXAI는 Grok 4.7을 코딩 및 지식 작업을 위한 가장 강력한 모델이라고 설명하며, 어려운 작업에서 더 오래 작동하고 자체 작업을 더 신중히 검토한다고 밝혔습니다. 회사는 이 모델이 현재까지 가장 정밀하게 조정된 안전장치를 탑재했으며, 전 모델인 Grok 4.6과 동일한 가격과 속도로 제공되고, 유사 모델 대비 절반 가격에 두 배 빠르다고 말했습니다.

더 큰 베이스 모델, 더 긴 훈련 실행

발표에 따르면, Grok 4.7은 Grok 4.6보다 새롭고 더 큰 베이스 모델을 사용했으며, 더 어려운 작업 혼합에 대해 더 긴 강화 학습을 진행해 여러 시간이 걸리는 문제에 중점을 두었습니다. SpaceXAI는 이 결과 모델이 자체 작업을 검증하고 더 긴 컨텍스트를 관리하는 데 뛰어나다고 말합니다.

회사 또한 Grok 4.7을 Grok Bot 하네스를 기본적으로 이해하도록 훈련시켜 대화형 작업과 일반 지식 작업에서 더 뛰어나게 만들었다고 밝혔습니다. SpaceXAI는 2026년 8월 11일에 Grok Bot을 소개하면서, 이를 자체 컴퓨터를 갖춘 상시 작동 에이전트 팀으로, 도구와 앱 내부에서 작업하고 24시간 내내 지속적으로 작동한다고 설명했습니다. 또한, 회사는 Grok 4.7이 문서와 프레젠테이션 생성에 더 뛰어나다고 말합니다.

Grok 4.7은 Grok 4.6의 후속 모델이며, SpaceXAI는 2026년 8월 12일에 발표하면서 이를 Grok 4.5를 기반으로 장기 실행 에이전트와 보다 야심찬 인터랙티브 및 시각 작업에 중점을 둔 모델이라고 설명했습니다. 2026년 8월 말에 회사는 Grok 4.6을 GitHub Copilot, Amazon Bedrock, Gemini Enterprise Agent Platform, Microsoft Foundry에 확장했으며, 이는 뉴스 아카이브에 날짜가 기재된 목록에 따라 확인됩니다.

보고된 벤치마크 점수

SpaceXAI는 Grok 4.7을 Grok 4.6, GPT-5.6 Sol, Fable 5.1과 비교한 벤치마크 및 가격 표를 공개했습니다. 표에서 Grok 4.7은 xhigh라는 노력 설정으로, Grok 4.6은 high, GPT-5.6 Sol과 Fable 5.1은 max로 표시됩니다.

SpaceXAI가 장기 코딩 작업을 강조한다고 말하는 CursorBench 4.0에서, 회사는 Grok 4.7이 46.3%를 기록했으며, Grok 4.6은 40.4%, GPT-5.6 Sol은 41.7%, Fable 5.1은 51.8%를 기록했다고 보고했습니다. SpaceXAI는 해당 벤치마크에서 Grok 4.7이 가격‑성능 면에서 최전선에 있다고 말합니다.

소프트웨어 엔지니어링 평가인 DeepSWE v1.1에서 SpaceXAI는 고노력 설정에서 Grok 4.7이 71.0%를 기록했으며, Grok 4.6은 65.2%, GPT-5.6 Sol은 72.7%, Fable 5.1은 70.0%를 기록했다고 보고했습니다. 여러 시간에 걸친 터미널 작업을 다루는 Terminal-Bench 4.0에서는 Grok 4.7이 38.0%, Grok 4.6이 20.3%, GPT-5.6 Sol이 37.3%, Fable 5.1이 57.9%를 기록했습니다.

다시간 사무 작업을 측정하는 AA Briefcase v1.1에서 보고된 점수는 Grok 4.7이 1,657점, Grok 4.6이 1,546점, GPT-5.6 Sol이 1,487점, Fable 5.1이 1,678점입니다. SpaceXAI는 Harvey Legal Agent Benchmark에서 Grok 4.7이 19.6%를 기록했으며, Grok 4.6은 15.8%, GPT-5.6 Sol은 2.5%, Fable 5.1은 6.7%를 기록했다고 보고했습니다. 임상 추론 평가인 HealthBench Professional에서는 Grok 4.7이 56.7%, Grok 4.6이 48.5%, GPT-5.6 Sol이 60.5%, Fable 5.1이 62.1%를 기록했습니다. 전기공학을 다루는 EEBench에서는 회사가 Grok 4.7이 64.0%, Grok 4.6이 53.0%, GPT-5.6 Sol이 39.4%, Fable 5.1이 56.4%를 기록했다고 보고했습니다.

별도의 GDPval 차트는 최대 노력에서 Fable 5.1이 1,735점, Grok 4.7이 1,695점, Grok 4.6이 1,605점, GPT-6 Astra가 1,542점을 기록했다고 보고합니다. SpaceXAI는 GDPval과 AA Briefcase가 변호사, 간호사, 금융 분석가와 같은 전문가가 수행하는 작업을 AI 모델에게 요구하며, Grok 4.7이 두 벤치마크 모두에서 Grok 4.6보다 개선되었고 다른 최첨단 모델과 비교해도 비슷한 성능을 보인다고 말합니다.

표에는 토큰 가격도 나와 있습니다: Grok 4.7 및 Grok 4.6은 입력 100만 개당 $2, 출력 100만 개당 $6, GPT-5.6 Sol은 각각 $4와 $20, Fable 5.1은 $10와 $50입니다.

안전장치 및 사이버 보안

SpaceXAI는 Grok 4.7이 완전히 새로운 안전장치 스택으로 구축되었으며, 거부 및 탈옥 저항성 테스트에서 회사가 시험한 모델 중 가장 강력하다고 말합니다. 사이버 보안 및 생물학 작업과 같은 이중 사용 분야에서, 회사는 Grok 4.7이 악의적이지 않은 작업에 대한 유용성과 위험한 작업에 대한 안전한 거부 모두에서 선두에 서며, LatchBio의 생물안전 벤치마크에서 62.4%로 최고 기록을 세웠다고 주장합니다.

SpaceXAI가 위험하고 악의적인 사이버 작업을 위한 자체 벤치마크라고 설명하는 HackerBench v0.3에서, 회사는 Grok 4.7이 위험한 이중 사용 프롬프트 중 3.3%만 통과시켰으며 정당한 보안 작업은 거의 차단하지 않았다고 말합니다. SpaceXAI는 또한 선택된 사이버 보안 파트너에게 방어 연구를 위한 Grok 4.7의 레드팀 기능에 초대 전용 접근 권한을 제공하기 시작했다고 밝혔습니다.

LatchBio는 이전에 회사 뉴스 아카이브의 2026년 9월 1일 게시물에 따르면, Grok 4.6을 생물보안 모니터링 및 적대적 생물학 작업에 대해 평가했으며, 해당 모델이 다른 최첨단 시스템보다 위험한 질의를 더 신뢰성 있게 탐지하고 거부했다고 밝혔습니다.

가격 및 가용성

Grok 4.7은 2026년 9월 21일부터 Cursor와 Grok Build, SpaceXAI의 코딩 에이전트에서 이용 가능하며, Grok API, 타사 코딩 하니스, 모델 라우터 및 클라우드 플랫폼을 통해서도 사용할 수 있습니다.

표준 요금제와 함께, SpaceXAI는 출력 속도가 두 배이고 가격도 두 배인 Grok 4.7의 고속 버전을 제공합니다. 또한 회사는 Grok Build 내부에서 모델에 대한 무료 접근을 x.ai/build에서 제공하고 있습니다.

Jonas Reeve는 Unite.AI의 AI 생성 분석가로, 인지 AI, 인공 일반 지능(AGI), 기계 지능의 이론적 기초에 중점을 둡니다. 그의 연구는 학습, 추론, 기억, 추상화가 생물학적 및 인공 시스템에서 어떻게 나타나는지 탐구하며, 현대적인 AI 아키텍처와 인지 과학 및 마음의 철학의 오래된 질문 사이의 연결을 그립니다.
개념적이고 반성적인 접근 방식을 통해 Jonas는 추론 모델, 에이전트 시스템, 출현적 인지, 정렬 이론과 같은 프레임워크를 조사하여 AGI로의 진보가 실제로 무엇을 의미하는지 및 무엇을 의미하지 않는지 명확히 합니다. 그는 타임라인이나 호재를 추구하는 대신 첫 번째 원칙, 개념적 엄격성, 현재 모델의 한계를 강조합니다.
Jonas Reeve가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 고급 AI 개념에 대한 정확성, 명확성, 책임있는 논의를 보장합니다.