사상 리더

AI 신뢰성 문제, 누구도 말하지 않는 것

mm
Unite.AI를 Google의 선호 소스에 추가

AI 신뢰성에 대한 지배적인 담론은 간단합니다. 모델은 환각을 일으킵니다. 따라서 기업이 모델에서 최대 효용을 얻으려면, 모델은 개선되어야 합니다. 더 많은 매개변수, 더好的 훈련 데이터, 더 많은 강화 학습, 더 많은 정렬.

그리고 아직, 가장 앞선 모델이 더 능숙해지면서도, 신뢰성 논쟁은 사라지지 않습니다. 기업 리더들은 여전히 에이전트가 핵심 시스템 내에서 의미 있는 행동을 취하는 것을 허용하기를 주저합니다. 이사회는 여전히 묻습니다. “우리가 그것을 신뢰할 수 있습니까?”

그러나 환각은 주로 모델 문제가 아닙니다. 그것은 맥락 문제입니다. 우리는 기업 인프라스트럭처에서 에이전트가 안전하게 추론할 수 있는 구조적 가시성을 제공하지 않고 에이전트를 운영하도록 요청하고 있습니다. 그런 다음 우리는 모델이 추측할 때 모델을 비난합니다.

진짜 신뢰성 갭은 가중치에서가 아니라 정보 계층에 있습니다.

이미징 없는 외과수

이미징 없는 외과수를 상상해 보십시오. MRI가 없습니다. CT 스캔이 없습니다. 주변 조직의 실시간 시각화가 없습니다. 단지 해부학에 대한 일반적인 이해와 skalpel이 있습니다. 가장熟練한 외과수도 추론을 피할 수 없습니다. 근사치를 사용해야 합니다. 확률적 추론에 의존해야 합니다.

그것이 현재 기업 AI 에이전트가 하는 일입니다.

에이전트가 워크플로우를 수정하거나 ERP 규칙을 업데이트하거나 도구 간 자동화를 트리거할 때, 그것은 환경에 대한 전체 종속성 그래프를 거의 가지고 있지 않습니다. 사용되지 않는 필드가 하위 ダッシュボード를 어떻게 제공하는지 모릅니다. 어떤 자동화가 유효성 검사 규칙을 참조하는지 보지 못합니다. 두 번째 주문 영향에 대한 시뮬레이션을 신뢰할 수 없습니다.

그러므로 그것은 큰 언어 모델이 훈련된 대로 합니다. 예측입니다. 예측은 이해와 다릅니다. 구조적 맥락이 없는 예측은 환각으로 보입니다.

우리는 잘못된 논쟁을 계속하고 있다

AI 커뮤니티는 모델 중심의 신뢰성 담론에 갇혀 있습니다. 스케일링 법칙에 대한 논문, 사슬-생각-추론 프롬프트에 대한 연구, 검색 보강 기술, 평가 벤치마크.

모두 필요합니다. 모두 가치 있습니다. 그러나 무엇이 빠져 있는지 주목하십시오. 기업 시스템 토폴로지에 대한 논의입니다.

기업 환경에서 신뢰성은 단순히 “모델이 올바른 텍스트를 생성한다”는 것을 의미하지 않습니다. 그것은 “시스템이 안전하고 추적 가능하며 예측 가능한 변경을 만든다”는 것을 의미합니다.

그것은 근본적으로 다른 요구 사항입니다.

OpenAI와 Anthropic이 모델 성능 평가를 발표할 때, 그들은 이유 작업, 코딩 벤치마크 또는 지식 회상에 대한 정확도를 측정합니다. 이러한 신호는 유용합니다. 그러나 에이전트가 15년간 축적된 자동화 부채가 있는 라이브 수익 시스템을 안전하게 수정할 수 있는 능력을 측정하지는 않습니다.

문제는 모델이 구문적으로 올바른 코드를 작성할 수 있는지 여부가 아닙니다. 환경을 이해하는지 여부입니다.

生きている 시스템은 엔트로피를 축적한다

기업 시스템은 정적인 데이터베이스가 아닙니다. 그것들은 살아있는 시스템입니다. 새로운 통합은 흔적을 남깁니다. 캠페인은 필드를 도입합니다. 각 “퀵 픽스”는 추가적인 자동화 계층을 도입합니다. 시간이 지남에 따라, 이러한 계층은 아무도 완전히 이해하지 못하는 방식으로 상호 작용합니다.

이것은 성장의 기능입니다. 복잡한 적응 시스템은 자연스럽게 엔트로피를 축적합니다. MIT 슬론 학교의 연구는 조직 내의 정보 비대칭이 운영 위험을 어떻게 합성하는지 오래 전부터 강조해 왔습니다. 한편, Gartner는 데이터 품질이 나쁨으로 인해 조직이 평균 12.9 백만 달러의 비용을 지불한다고 추정합니다.

이제 이 환경에 에이전트를 삽입하는 것을 상상해 보십시오. 그러나 먼저 그들의 구조적 불투명성을 해결하지 않고.

우리는 결과가 예측할 수 없게 느껴질 때 놀라는 것이 아닙니다. 에이전트는 악의적이거나 어리석지 않습니다. 그것은 눈이 먼 것입니다. 그것은 어둠 속에서 구축하고 있습니다.

검색은 충분하지 않다

일부 사람들은 검색-증강 생성(RAG)이 이 문제를 해결한다고 주장할 것입니다. 모델에 문서에 대한 액세스를 제공하십시오. 스키마 설명을 제공하십시오. API에 연결하십시오.

그것은 도움이 됩니다.

그러나 문서는 토폴로지가 아닙니다.

워크플로우가 “어떻게 작동해야 하는지”에 대한 PDF는 실제로 17개의 다른 자동화와 상호 작용하는 방식의 실시간 그래프와 다릅니다.

기업 현실은 기업 문서와 거의 일치하지 않습니다.

2023年の Communications of the ACM에 발표된 연구는 소프트웨어 개발에서 강력한 문서화의 중요성을 강조했습니다. 시스템은 내러티브보다 더 빠르게 진화합니다.

따라서 우리는 에이전트에게 문서를 제공할 때, 우리는 czę々적으로 부분적이거나 이상적인 맵을 제공하고 있습니다.

부분 맵은 여전히 자신감 있는 실수를 생성합니다.

에이전트 계층은 실제 안전 계층이다

우리는 안전을 정렬 훈련, 가드레일, 적색 팀, 정책 필터로 생각하는 경향이 있습니다. 모두 중요합니다. 그러나 기업 환경에서 안전은 맥락적입니다. 그것은 다음을 아는 것입니다:

  • 이 필드는 무엇에 의존합니까?
  • 어떤 자동화가 이 개체를 참조합니까?
  • 어떤 하위 보고서가 깨질 것입니까?
  • 이 프로세스를 누가 소유합니까?
  • 이것은 언제 마지막으로 수정되었습니까?
  • 현재 구성 이전에 어떤 역사적인 변경이 있었습니다?

이 계층이 없으면 에이전트는 효과적으로 블랙 박스 안에서 즉흥적으로 행동합니다. 이 계층이 있으면 에이전트는 행동하기 전에 영향을 시뮬레이션할 수 있습니다. 환각과 신뢰성의 차이는 종종 가시성의 차이입니다.

모델이 비난을 받는 이유

그러면 왜 논쟁이 모델에 så 중점을 두고 있습니까? 모델은 가독성이 있습니다. 우리는 퍼플렉시티를 측정할 수 있습니다. 우리는 벤치마크 점수를 비교할 수 있습니다. 우리는 스케일링 곡선을 게시할 수 있습니다. 우리는 훈련 데이터의 품질을 논의할 수 있습니다.

기업 내의 정보 토폴로지는 훨씬 더 더럽습니다. 그것은 跨機能적 조정을 필요로 합니다. 그것은 治理 규율을 요구합니다. 그것은 조직이 자신의 시스템의 축적된 복잡성을 직면하도록 강요합니다.

“모델이 준비되지 않았다”라고 말하는 것이 “우리 인프라가 불투명하다”라고 말하는 것보다 쉽습니다.

그러나 에이전트가 콘텐츠 생성에서 운영 실행으로 이동할 때, 이러한 프레임은 위험해집니다.

만약 우리가 신뢰성을 모델 문제로만 다루면, 우리는 환경을 의미 있게 인식할 수 없는 에이전트를 계속 배포할 것입니다.

자율성은 맥락을 필요로 한다

Anthropic의 최근 실험은 다중 에이전트 소프트웨어 개발 팀이 구조화된 맥락과 지속적인 메모리를 제공받을 때 복잡한 작업을跨적으로 조정할 수 있음을 보여주었습니다. 능력 프론티어는 급속히 발전하고 있습니다. 그러나 환경 인식 없이 이러한 브랜드의 자율성은 취약합니다.

자율 주행 자동차는 강력한 신경망만에 의존하지 않습니다. 그것은 라이더, 카메라, 매핑 시스템, 실시간 환경 감지에 의존합니다. 모델은 더 넓은 인식 스택 내의 한 계층입니다.

기업 AI는 라이더와 같은 것을 필요로 합니다. 단지 API 액세스나 문서가 아닙니다. 구조화된, 동적 인 시스템 종속성 이해입니다.

그것이 존재하지 않는 한, 환각에 대한 논쟁은 계속해서 근본 원인을 오진할 것입니다.

숨겨진 위험:過信

현재 프레임에 또 다른 미묘한 위험이 있습니다.

모델이 개선됨에 따라, 그들의 출력은 더 유창해지고, 더 설득력있게 되고, 더 권위적으로 됩니다.

유창성은過信을 증폭시킵니다.

에이전트가 맥락 없이 시스템을 수정할 때, 실패는 즉시 명확하지 않을 수 있습니다. 그것은 몇 주 후에 보고서 불일치, 규제 격차 또는 수익 예측 오류로 나타날 수 있습니다. 모델이 유능해 보이기 때문에, 조직은 그들의 운영 안전을 과대평가할 수 있습니다. 실제 실패 모드는 설득력 있는 계산 오류입니다.

그리고 설득력 있는 계산 오류는 어둠 속에서 번창합니다.

신뢰성 질문을 재구성하는 것

“모델이 충분한가?”라는 질문을 하는 대신에, “에이전트가 안전하게 행동할 수 있는 구조적 맥락을 가지고 있는가?”라는 질문을 해야 합니다. 벤치마크 정확도를 측정하는 대신에, 환경 가시성을 측정해야 합니다. 매개변수 수를 논의하는 대신에, 시스템 불투명성을 감사해야 합니다.

AI 신뢰성의 다음 프론티어는 단순히 더 큰 모델이 아닙니다. 그것은 더 풍부한 맥락 계층입니다.

이것은 다음을 포함합니다:

  • 기업 시스템의 종속성 그래프
  • 실시간 변경 추적
  • 소유권 매핑
  • 歴史적 구성 인식
  • 실행 이전에 영향 시뮬레이션

이것은 모두 화려하지 않습니다. 이것은 소셜 미디어에서 트렌드하지 않습니다. 그러나 이것은 신뢰성이 승리될 곳입니다.

불을 켜고 구축하는 것

기업 리더들은 에이전트에게 운영 권한을 부여하기 전에 신뢰성을 요구하는 것이 옳습니다. 그러나 앞으로의 길은 환각이 없는 모델을 기다리는 것이 아닙니다.

그것은 지능적인 행동을 가능하게 하는 가시성 인프라에 투자하는 것입니다.

우리는 주니어 관리자가 종속성을 이해하지 못한 채 생산 시스템을 변경하지 않도록 허용하지 않습니다. 우리는 에이전트에게도 그렇게 허용해서는 안 됩니다.

목표는 블라인드 스폿을 줄이는 것입니다.

에이전트가 구조적 인식과 함께 작동할 때, 환각률은 모델이 변경된 것이 아니라, 추측 표면이 줄어든 이유로 감소합니다.

예측은 추론이 됩니다. 추론은 시뮬레이션이 됩니다. 시뮬레이션은 안전한 실행이 됩니다.

inevitable Shift

다음 5년 동안, AI 스택은 분기될 것입니다. 하나의 계층은 모델 능력에 초점을 맞출 것입니다. 이유 깊이, 멀티모달 유창성, 비용 효율성. 다른 계층은 정보적/맥락적 토폴로지에 초점을 맞출 것입니다. 시스템 그래프, 메타데이터 지능, 治理 프레임워크.

신뢰성을 모델 선택 연습으로만 다루는 조직은 어려움을 겪을 것입니다.

신뢰성을 건축적 특성으로 다루는 조직은 더 빠르고 더 적은 위험으로 이동할 것입니다.

환각 논쟁은indsight에서 볼 때 어리석어 보일 것입니다. 실제 이야기는 가시성에 관한 것입니다.

AI는 본질적으로 무모하지 않습니다.

그것은 어둠 속에서 작동하고 있습니다.

우리가 그것을 해결하지 않는 한, 우리는 지능적인 시스템을 구축하고 있지 않습니다. 우리는 불투명한 환경 내에서 강력한 예측기를 구축하고 있습니다.

그리고 그것은 의미합니다. 모든 진행에도 불구하고, AI는 여전히 어둠 속에서 구축하고 있습니다.

이도 가버는 Sweep의 CEO이자 공동 창립자로서 AI, 메타데이터 아키텍처, 및 엔터프라이즈 거버넌스 간의 교차점에서 연구 및 제품 전략을 주도합니다. 그의 업무는 대규모 엔터프라이즈 소프트웨어 생태계 내에서 에이전트 AI 시스템이 안전하게 및 상황적으로 작동할 수 있도록 하는 데 중점을 두고 있습니다.