사상 리더

AI가 사실을 만들어낼 때: 무시할 수 없는 기업 위험

mm
Unite.AI를 Google의 선호 소스에 추가

听起来 괜찮아 보이지만, 그것은 잘못된 것입니다. 그것은 당신의 AI가 환각을 일으키고 있는 것입니다. 문제는 오늘날의 생성형 AI 모델이 환각을 일으키는 것이 아니라, 우리가 충분한 가드를 설치하고, 미세하게 조정하고, RAG를 적용하고, 어쩌면 irgendwie를 적용하면 엔터프라이즈 규모에서 이를 채택할 수 있을 것이라는 생각입니다.

연구 도메인 환각률 주요 발견
Stanford HAI & RegLab (2024년 1월) 법률 69%–88% LLM은 법률 질의에 대한 응답에서 높은 환각률을 보였으며, 종종 자신의 오류에 대한 자기 인식이 부족하고 잘못된 법적 가정을 강화했습니다.
JMIR 연구 (2024년) 학술 참고문헌 GPT-3.5: 90.6%, GPT-4: 86.6%, Bard: 100% LLM 생성된 참고문헌은 종종 관련이 없거나, 잘못되었거나, 이용 가능한 문헌으로 지원되지 않았습니다.
영국 연구: AI 생성 콘텐츠 (2025년 2월) 금융 지정되지 않음 AI 생성된 허위 정보는 은행 운영 위험을 증가시켰으며, 은행 고객의 상당수는 AI 생성된 가짜 콘텐츠를 본 후 돈을 이동하는 것을 고려했습니다.
세계 경제 포럼 글로벌 위험 보고서 (2025년) 글로벌 위험 평가 지정되지 않음 허위 정보와 잘못된 정보, AI에 의해 증폭되며, 2년간의 전망에서 최상위 글로벌 위험으로 평가되었습니다.
Vectara 환각 리더보드 (2025년) AI 모델 평가 GPT-4.5-Preview: 1.2%, Google Gemini-2.0-Pro-Exp: 0.8%, Vectara Mockingbird-2-Echo: 0.9% 다양한 LLM의 환각률을 평가하여 성능과 정확성에 대한 상당한 차이를 보여주었습니다.
Arxiv 연구: 사실성 환각 (2024년) AI 연구 지정되지 않음 HaluEval 2.0를 도입하여 LLM의 환각을 체계적으로 연구하고 감지했습니다. 사실적 부정확성에 초점을 맞추었습니다.

환각률은 0.8%에서 88%까지입니다

예, 모델, 도메인, 사용 사례 및 컨텍스트에 따라 다르지만, 이러한 분포는 엔터프라이즈 의사결정자를 불안하게 만들 것입니다. 이러한 오류는 에지 케이스가 아닙니다. 그것은 시스템적인 것입니다. 엔터프라이즈에서 AI를 채택할 때 올바른 결정을 내리는 방법은 무엇입니까? 어디서, 어떻게, 얼마나 깊이, 얼마나 넓게?

이러한 현실 세계의 결과는 매일 뉴스 피드에서 볼 수 있습니다. G20의 금융 안정성 위원회는 생성형 AI를 허위 정보의 수단으로 지적하며, 시장 위기, 정치적 불안정성 및 더 나쁨의 경우 플래시 크래시, 가짜 뉴스 및 사기와 같은 위험을 증가시킬 수 있습니다.最近의 다른 보고서에서는 모간 & 모간 법률사무소가 모든 변호사에게 긴급 메모를 발송했습니다. AI 생성된 서류를 검토하지 않고 제출하지 마십시오. 가짜 판례는 해고할 수 있는 범죄입니다.

이제 환각률이 곧 0으로 수렴할 것이라는 베팅을 하는 것은 좋은 시기일 수 없습니다. 특히 법률, 생명 과학, 자본 시장 등 규제된 산업에서 오류의 비용이 높을 수 있으며, 출판된 고등 교육과 같은 경우에도 마찬가지입니다.

환각은 반올림 오차가 아닙니다

이것은 가끔 잘못된 답변에 관한 문제가 아닙니다. 그것은 위험입니다: 평판, 법적, 운영적 위험.

생성형 AI는 추론 엔진이 아닙니다. 그것은 통계적 마무리자, 확률적 파로ット입니다. 그것은 훈련 데이터에 기반하여 가장 가능성 있는 방식으로 프롬프트를 완성합니다. 심지어 진실한 부분도 추측입니다. 우리는 가장 황당한 부분을 “환각”이라고 부르지만, 전체 출력은 환각입니다. 잘 꾸민 것입니다. 그래도 잘 작동합니다 – 마법처럼 잘 작동합니다. 하지만 작동하지 않는다면?

AI는 인프라입니다

그러나 AI가 엔터프라이즈 전체에서 채택될 준비가 되었을 때, 우리는 그것을 인프라로 다루어야 합니다. 그리고 필요한 경우,それは 투명하고, 설명 가능하며, 추적 가능해야 합니다. 그리고 그렇지 않으면, 그것은 엔터프라이즈 전체에서 채택될 준비가 되지 않았습니다. AI가 의사결정을 내린다면, 그것은貴社의 이사회에서 논의되어야 합니다.

EU의 AI법은 여기서 선도적인 역할을 하고 있습니다. 법률, 의료, 인프라와 같은 고위험 도메인은 미션 크리티컬 시스템으로 규제될 것입니다. 문서화, 테스트, 설명 가능성이 필수입니다.

엔터프라이즈 안전 AI 모델이 하는 일

엔터프라이즈 안전 AI 모델을 구축하는 회사들은 의도적으로 다른 방식으로 AI를 구축합니다. 그들의 대안 AI 아키텍처에서는 언어 모델이 데이터에 훈련되지 않으므로, 데이터에 있는 모든 불량한 내용, 즉 편향, 지적 재산권 침해 또는 추측 또는 환각의 가능성에서 자유로울 수 있습니다.

이러한 모델은 “당신의 생각을 완성”하지 않습니다 – 사용자의 콘텐츠에서 추론합니다. 사용자의 지식 베이스, 문서, 데이터에서 추론합니다. 답이 없으면 이러한 모델은 그렇게 말합니다. 이것이 이러한 AI 모델이 설명 가능하고, 추적 가능하고, 결정적이며, 환각이 용인될 수 없는 곳에서 좋은 선택이 되는 이유입니다.

AI 책임에 대한 5단계 플레이북

  1. AI 랜드스케이프를 매핑 -貴社의 비즈니스에서 AI가 어디서 사용되고 있는가? AI가 어떤 의사결정을 영향하고 있는가?貴社는 투명한 분석과 신뢰할 수 있는 출처 자료로 의사결정을 추적할 수 있는 능력에 어떤 프리미엄을 두고 있는가?
  2. 貴社를 정렬 -貴社의 AI 배포 범위에 따라, 금융 또는 사이버 보안 위험과 같은 역할, 위원회, 프로세스 및 감사 관행을 설정합니다.
  3. AI를 이사회 수준의 위험으로 가져오기 -貴社의 AI가 고객이나 규제 기관과 통신한다면, 그것은貴社의 위험 보고서에 포함되어야 합니다. 거버넌스는 부차적이지 않습니다.
  4. 벤더를 공동 책임자로 다루기 -貴社의 벤더의 AI가 허위 사실을 만들면,貴社는 여전히 그 결과를 소유합니다.貴社의 AI 책임성 원칙을 벤더에게 확장합니다. 문서화, 감사 권한 및 설명 가능성 및 환각률에 대한 SLA를 요구합니다.
  5. 회의주의를 훈련 -貴社의 팀은 AI를 유용하지만, 불가타한 주니어 분석가로 다루어야 합니다. 누군가가 환각을 식별할 때庆祝합니다. 신뢰는 획득되어야 합니다.

엔터프라이즈의 AI 미래는 더 큰 모델이 아닙니다. 필요한 것은 더 많은 정밀도, 더 많은 투명성, 더 많은 신뢰, 더 많은 책임성이 필요합니다.

조이 다스구프타는 Gyan의 CEO이며, Hewlett-Packard, American Express, Genpact와 같은 회사에서 2십년 이상의 글로벌 리더십 경험을 가진 AI驱動 솔루션의 선임 리더입니다. Gyan은 기업에서 환상, 지적 재산 위험, 또는 에너지 소모적인 모델에 대한 허용 범위가 낮거나 없을 때 사용하기 위한 근본적으로 새로운 AI 아키텍처입니다. 신뢰, 정밀도, 책임이 중요한 곳에서 Gyan은 모든 통찰력이 설명 가능하고, 신뢰할 수 있는 출처로 추적 가능하며, 데이터 개인 정보 보호가 핵심입니다.