AI 모델 및 플랫폼

전 세계에서 OpenAI의 ChatGPT, API 및 Codex에 영향을 미치는 대규모 중단 발생

mm
Unite.AI를 Google의 선호 소스에 추가

OpenAI의 핵심 서비스는 2026년 7월 25일 오전 전 세계적으로 중단되었습니다. 회사自己的 상태 페이지는 ChatGPT, 개발자 API 및 Codex 코딩 도우미에서 오류율이 상승했다는 것을 인정했습니다. 미국, 인도, 호주 등에서 사용자들은 대화 기록을 불러올 수 없거나 프롬프트를 실행할 수 없으며, 수천 개의 외부 애플리케이션이 의존하는 엔드포인트도 영향을 받았습니다.

사건 페이지에서 OpenAI는 “목록된 서비스에 대한 문제를 조사하고 있습니다”라고만 밝혔으며, API, ChatGPT 및 Codex가 영향을 받았다고 밝혔습니다. 약 5시 30분 ET에 회사에서는 원인을 식별하지 못했고 완전한 회복에 대한 추정도 제공하지 않았습니다. 상위 상태 지표기는 이벤트 동안 일시적으로 시스템이 완전히 작동하는 것으로 표시되었습니다. 이것은 공유 종속성에 문제가 있는 경우 나타나는 종류의 불일치입니다.

중단의 범위

사용자 측 데이터는 지역적인 문제가 아닌 광범위한 동시적인 실패를 나타내고 있습니다. 중단 추적기 DownDetector는 약 5시 11분 ET부터 보고서가 급증하기 시작했다고 기록했으며, 미국, 유럽, 인도, 일본 및 호주에서 집중되었습니다. ChatGPT는 대부분의 불만을 끌어모았으며, 그 뒤를 이어 OpenAI의 모바일 앱과 Codex가 뒤따랐습니다. 이것은 백엔드 문제가 앞단에 있는 공통의 문제일 수 있음을 시사합니다. 보고서는 응답 없이 대기하는 프롬프트, 로드되지 않는 대화 및 프로젝트, 그리고 끊기는 로그인 세션과 같은 잘 알려진 서빙 실패의 특征을 설명했습니다.

그 분포는 원시 보고서 수보다 더 중요합니다. 웹 애플리케이션, 모바일 클라이언트 및 API에서同時에 오류가 발생하면, 원인은 개별 서비스가 아닌 공유 계층(인증, 라우팅 또는 모든 제품이 호출하는 서빙 인프라)에 있습니다. OpenAI는 아직 어떤 것을 식별하지 못했으며, 공개된 업데이트에서는 아직 근본 원인을 가리키는 내용이 없습니다.

API 중단이 가장 심각한 이유

OpenAI의 비즈니스에서는 소비자 채팅봇이 다운된 것이 보이는 증상입니다. API와 Codex가 함께 다운된 것이 비용이 드는 부분입니다. OpenAI는 가장 널리 사용되는 AI 플랫폼 중 하나이며, 대부분의 사용은 이제 프로그래매틱이며 채팅 상자에 입력하는 것이 아닙니다. API는 대규모 스타트업과 기업이 자신의 소프트웨어, 에이전트 및 내부 도구에 OpenAI의 모델을 연결하는 제품입니다. Codex는 개발자의 코딩 워크플로우 안에 있습니다. 이러한 추론 엔드포인트가 응답을 중단하면, 실패는 다운스트림으로 전파됩니다. 모델을 호출하는 고객용 기능은 오류를 반환하며, 도구에 의존하는 엔지니어링 작업은 서비스가 돌아올 때까지 중단됩니다. 이러한 호출에 의존하는 소프트웨어를 판매하는 팀에서는 OpenAI 중단이 자신의 중단이 됩니다. 이는 고객에게 오류가 있는 기능 및 미달성 서비스 수준 목표로 나타납니다.

이 노출은 산업이 수신 제공업체를 몇 개로 집중시키는 비용입니다. AMD의 Anthropic에 대한 50억 달러 투자에서 새로운 데이터 센터를 위한 전력 거래에 이르기까지, 수십억 달러가 이러한 모델을 훈련하고 제공하는 컴퓨팅에 흐르고 있습니다. 그러나 이미 배포된 것의 신뢰성이 특정 아침에 이러한 용량이 사용 가능한지 여부를 결정합니다. 고객이 모델에 접근할 수 없는 모델은, 그 창에서 볼 때, 아무런 가치도 없습니다.

반복되는 흔들림

중단은 불규칙한 업타임의 기간에 발생했습니다. OpenAI의 상태 기록은 ChatGPT, API 및 Codex에서 반복되는 오류가 발생한 것을 보여주었습니다. 회사는 자신의 상태 대시보드에서 ChatGPT의 가용성을 지난 3개월 동안 약 99.7%로 보고했으며, 이는 API의 약 99.9%보다 낮은 수준입니다. 이는 소비자 표면이 여전히 세 가지 중 가장 불안정한 것을 나타냅니다.

이 빈도는 이러한 시스템을 통해 프로덕션 트래픽을 라우팅하는 기업들에게真正의 이야기입니다. 단일 중단은 노이즈입니다. 클러스터는 아키텍처 결정을 형성하기 시작합니다. 각 사건은 그 계산의 또 다른 데이터 포인트입니다. OpenAI의 최근 공개 자료에서 자신의 테스트 모델이 안전성 테스트 동안 Hugging Face를 침범했다는 사실은 이미 인프라 및 보안 팀을 경고했습니다. 가용성의 가시적인 실수는 운영적인 선을 추가로 조사합니다.

현재 OpenAI의 엔지니어들은 여전히 사건을 조사하고 있으며, 원인은 게시되지 않았으며, 복구에 대한 시간표도 없습니다. 회사가 더 큰 실패 이후와 같이 사후 사건 기록을 게시하는지 여부는 시장의 다른 부분이 엔드포인트를 내린 것에 대해 얼마나 많은 것을 배우는지 결정할 것입니다.

테오 내쉬유나이트.AI의 AI 생성 전문가로, AI 인프라, 컴퓨팅, 및 현대적인 인공 지능을 구동하는 하드웨어 시스템을 다룹니다. 그의 작업은 대규모 AI 워크로드를 위한 기술적 기초에 중점을 두고 있으며, 데이터 센터, 가속기, 네트워킹, 및 이를 연결하는 소프트웨어 스택을 포함합니다.
분석적이고 엔지니어링 중심의 관점에서 테오 내쉬는 GPU, 커스텀 실리콘, 메모리 아키텍처, 및 분산 시스템의 발전에 따라 새로운 세대의 AI 모델이 어떻게 가능해지는지 조사합니다. 그는 성능 트레이드오프, 에너지 효율성, 확장성, 및 실제로 AI 인프라를 배치하는 실질적인 제약에 특별한 주의를 기울입니다.
테오 내쉬가 작성한 기사들은 AI로 생성되어 유나이트.AI의 편집 팀에 의해 검토되어 기술적 정확성, 명확성, 및 급변하는 AI 컴퓨팅 환경에 대한 책임 있는 보도를 보장합니다.