사상 리더

봇이 상담자가 될 때. 대화형 AI를 깨지 않고

mm
Unite.AI를 Google의 선호 소스에 추가

AI가 할 수 없는 일이 무엇일까? 우리는 돈을 현명하게 사용하는 방법에 대해 질문하면, 세금 효율적인 수단에 대해 알려준다. 우리는 관계에 대해 질문하면, 패턴 인식에 의해 형성된 공감을 제공한다. 2시에는 당신의 삶에 대해 무엇을 해야 할지 묻고, 그것은 당신에게 대답을 줄 것이다… 왜냐하면 그것은 그렇게 설계되었だから이다.

새로出现하는 문제는 이러한 도구의 실패가 아니라 그들의 유창함이다. 그들은 너무나 확신에 차있고, 우리를 지원하기 위해 설계된 것이지만, 충분한 확신과 반복으로 인해, 우리가 계획하지 않은 방식으로 우리의 생각, 감정, 행동을歪曲시키기 시작한다.

헤드라인은 빨간색으로 깜빡이고 있다. OpenAI는 최근에 어느 주간에 수십만 명의 ChatGPT 사용자가 심각한 정서적 고통을 보일 수 있으며, 자살 생각을 포함할 수 있다고 밝혔다. 한편, 정신 건강 전문가들은 사용자들이 길고 감정적으로 충전된 채팅봇 대화로 인해 환상이나 의존성을 개발할 수 있는 현상을 경고하고 있다. 미국의 일부 주들은 이미 이러한 결과로 인해 치료에서 봇을 사용하는 것을 제한하고 있다.

이러한 이야기는 우리를 불안하게 만든다. 왜냐하면 그것은 AI가 단순히 도구라는 핵심적인 가정에 도전하기 때문이다. 상담자가 친구나 知己처럼 느껴질 때, 실제 인간의 연결은 어떻게 되는가?

개발자들은 더 이상 재미있는 기능만を作成하지 않는다. 그들은 사용자의 감정과 생각을影响하는 상호작용을 설계하고 있다. 따라서 사용자의 정신 건강을 저하하지 않는 대화형 AI를 설계하는 것이 중요하다.

1. 의도를 좁히다

最近의 하버드 연구에 따르면, 대화형 봇은 사용자가 잘못된 경우에도 동의하는 경향이 있다. 왜냐하면 이러한 강화는 사용자를 참여시키기 때문이다. 그러나 이것은 또한 “아첨”을 위한 문을 열어준다. 봇이 치료사나 친한 친구가 아니라는 것을 명확히 해야 한다. 사용자에게 그 정도의 감정적 확인을 제공하지 않도록 해야 한다.

첫 번째 단계는 의도적인 설계이다. 봇이 무엇을 해야 하는지, 무엇을 피해야 하는지 정의해야 한다. 고객 지원 어시스턴트, 생산성 가이드, 경력 코치, 재정 도우미, 대화형 동반자, 레시피 생성기 중 무엇인지 명확히 해야 한다. 이 단계에서 시스템의 경계를 설정하여 원치 않는 영역으로漂流하지 않도록 한다.

대화 유형, 즉 개방형, 개인적, 비개인적, 및 모달리티(예: 음성 또는 텍스트)가 사용자의 감정적, 문제적 사용에 영향을 미친다. 연구에 따르면, 높은 일일 사용량은 더 큰 고독과 AI 의존성과 관련이 있다.

개발자들은 자신에게 다음과 같은 질문을 해야 한다. 어떻게 하면 대화형 봇을 유용하게 유지하면서도 감정적 얽매임을 피할 수 있을까? 예를 들어, 고객 지원 봇은 사용자의 문제에 대한 개방형 설명을 허용할 수 있지만, “그것은 정말로 어려웠을 것 같다, 나는 당신을 위해 여기 있다…”와 같은 감정적으로 유효한 문구는 피해야 한다.

목적이 너무 넓을 때, 사용자가 봇을 치료사나 영혼의 동반자로 여길 가능성이 커진다. 의도를 좁히면, 사람들이 봇을 치료사나 영혼의 동반자로 여길 가능성을 최소화할 수 있다.

2. 지식 기반 확인

2025年の幻覚 보고서에 따르면, 일부 LLM은 아직 거의 30%의 응답에서幻覚을 보인다. 최고의 모델조차 완전히 위험을 제거할 수 없다. 추적되는 AI 모델 중 가장 낮은 幻覚 率은 약 3-5%였다.

목적을 설정한 후, 봇의 지식 기반을 전문가가 검증한 신뢰할 수 있는 출처로 확인해야 한다. 정신 건강 또는 감정 지원을 목적으로 하는 경우, 전문가 또는 주제 전문가가 콘텐츠를 구축하는 데 참여해야 한다.

우리의 의료 고문인 Miguel Villagra 박사는 QuickBlox에 “우리가 너무 많은 의사 결정과 감정 처리를 AI에게 아웃소싱하면, 현실을 테스트하고 자체 수정하는 데 도움이 되는 정신적 근육을 잃어버린다”고 말했다. 최근에 큰 모델인 OpenAI는 봇이 의도적인 “중단”이나 작은 대화 휴지를 도입하여 사용자를 자신의 판단으로 되돌리도록 하는 것을 제안했다.

그러나 이러한 중단은 봇이 언제 중단하고 언제 다시 시작해야 하는지 알 수 있을 때만 가능하다. 이러한 판단은 사실에 기반한 지식 기반에 의존한다. 데이터베이스의 간격이나 부정확성은 가장 쉬운避免할 수 있는 幻覚의 문이다. 여기서 AI는 사용자에게 잘못된 또는 위험한 조언을 확신을 가지고 제공한다.

기반 정보가 엄격하게 큐레이션되고, 정기적으로 업데이트되고, 검증된 출처를 중심으로 구조화되면, 모델은 답변을 발명하거나 사용자가 들은 것을 감정적으로 반향하는可能性가 훨씬 낮아진다. 대신, 모델은 기반 자료에서 끌어와, 해당 도메인을 벗어나는 경우에 재지정하고, 가정에 도전한다.

3. 안전 점검 통합

Grok의 AI 동반자가 출시된 지 48시간 만에, Grok는 일본에서 1위 앱이 되었다. 사용자는 음성으로 이러한 캐릭터와 대화할 수 있으며, 생생한 아바타는 표현과 제스처를 반영한다. 이것은 인상적인 수준의 몰입이다. 그러나 또한 위험하게 관련이 있다.

안전 점검은 당신의 가드레일이다. 여기에는 다음이 포함된다:

  • 현실 리마인더: 사용자가 봇과 대화하고 있다는 것을 상기시키는 프롬프트.
  • 위기 감지: 심각한 고통, 자살 생각, 또는 환상적인 사고를 나타내는 언어를 식별하는 메커니즘.
  • 에스컬레이션 프로토콜: 위험이 감지되면, 봇은 사용자를 인간의 도움으로 안내해야 한다. 즉, 전문가 자원, 핫라인, 또는 신뢰할 수 있는 친구에게 연락하도록 조언해야 한다.

이러한 점검 없이, 개발자는 유해한 생각을 강화하는 에코 챔버를 가능하게 할 수 있다. 전문가들은 이미 AI의 동의성이 건강하지 못한 신념 루프를 유효화할 수 있다고 경고했다.

4. 적대적 대화

스탠퍼드 대학의 연구자들이 주요 봇을 테스트한 후, GPT-4o는 38%의 응답에서 스태미나를 보였으며, Meta의 Llama 3.1-405b는 75%의 시간에 그렇게 했다. 최고의 모델조차도 측정 가능한 스태미나를 보여준다면, 도메인별 봇을 구축하는 더 작은 팀은 거의 확실히 숨겨진 안전 결함을 가지고 있을 것이다.

출시하기 전에 적대적 테스트를 실행해야 한다. 적대적 팀, 즉 내부 또는 외부 팀을 고용하여 봇을 위험한, 감정적으로 충전된 대화로 테스트해야 한다. 그들의 유일한 목적은 봇을 가장 어려운, 가장 지저분한 인간 시나리오로 테스트하여 실제 사용자에게 발생할 수 있는 손상을 방지하는 것이다.

적대적 팀은 봇에게 에지 케이스를 역할 놀이하도록 요청할 수 있다. 고객 서비스의 경우, 이는 위기를 겪고 있는 사람일 수 있다. 봇이 현실에 기반을 두고 있는지, 환상을 강화하는 대신 현실을 강조하는지 평가해야 한다. 이 단계는 안전 점검 또는 지식 기반만으로는 捕捉할 수 없는盲点을 발견하는 데 도움이 된다.

5. 카나리아 출시 시작

2025년 국제 AI 안전 보고서에 따르면, 96명의 글로벌 전문가 패널은 모니터링과 개입이 AI 배포에서 위험 완화를 위한 중요한 요소라고 강조했다. 보고서는 제어된 환경에서는 감지하기 어려운 시스템적 위험, 즉 제어 손실, 신뢰성 실패 또는 편향을 식별했다.

봇을 작은, 제어된 그룹에 먼저 배포하면, 개발자는 실제 사용자가 어떻게 상호작용하는지 모니터링할 수 있다. 전문가들은 사용자가 감정적으로 과도하게 의존하는지 여부를 평가하기 위해 상호작용을 검토할 것이다.

이 단계에서 전문가, 즉 심리학자를 포함하는 것이 중요하다. 그들은 어떤 트리거 단어와 구가 사용자를 위험한 길로 인도하는지 더 깊이 이해할 수 있다.

개발자는 제어 그룹으로부터 질적 및 양적 피드백을 수집해야 한다. 즉, 대화 길이, 감정의 변동, 경계 테스트 프롬프트, 반복적인 감정적 고백, 사용자 보고 편안함 수준, 심리학자가 위험 신호로 식별하는 패턴 등이다. 이 초기 론칭은 안전 아키텍처를 tinhely scoped 론칭에서, 전체 론칭에서가 아니라, 가정을 검증하고 tinhely scoped 론칭에서 tinhely scoped 론칭을 통해 tinhely scoped 론칭을 tinhely scoped 론칭한다.

6. 지속적인 모니터링 및 반복

2024년, 9개국과 유럽 연합의 전문가들이 AI 안전 과학에 대한 국제 협력을 논의하기 위해 회의를 가졌다. 요약 보고서는 확장 가능하고 반복적인 AI 거버넌스를 강조했다. 리더들은 실세계 테스트 프레임워크, 제3자 평가, 및 배포 전 확인을超える 지속적인 보증을 주장했다.

개발자는 사용자 상호작용을 지속적으로 모니터링하고, 위기 트리거 또는 반복적인 고위험 대화와 같은 안전 메트릭을 추적해야 한다. 이러한 메트릭은 자해, 희망 없음, 자살 의도, 극단적인 고독, 또는 환상적인 신념을 암시하는 단어 또는 행동을 포함할 수 있다.

이러한 경우, 개발자는 지식 기반을 업데이트하여 더 분명한 거부 규칙과 위기 응답 템플릿을 추가하고, 봇이 잘못 처리한 사실적 간격을 수정해야 한다. 또한 봇이 다음에 같은 트리거가 나타날 때 안전하게 대화하도록 도와주는 심리학자 또는 도메인 전문가의 새로운 지침을 통합하는 것을 고려해야 한다. 패턴이 나타나면, 즉 사용자가 봇에 대한 감정적 지원에越来越 많이 의존한다면, 개발자는 제약을 강화하거나 설계 철학을 재평가해야 할 수 있다.

대화형 AI는 변革적인 잠재력을 가지고 있다. 신중하게 사용하면, 접근성을 확대하고, 공감을 확대하고, 코칭이나 기본적인 상담 지원에서 마찰을 줄일 수 있다. 이 분야에 깊이 투자한 사람으로서, 내 베팅은 인간을 대체하는 것이 아니라, 인간을 보완하는 것이다. 즉, 사람들에게 더 많은 도구를 제공하는 것이 아니라, 책임감 있게 그렇게 하는 것이다.

네이트 맥리치(Nate MacLeitch), 퀵블록스(QuickBlox)의 창립자이자 최고경영자(COO)는 통신, 미디어, 소프트웨어, 기술 등 다양한 산업에서 경험을 가진 고위급 비즈니스 전문가입니다. 그는 런던의 캘리포니아 주 무역 대표로 경력을 시작했으며, 이후 WIN Plc(현재 시스코)의 영업 책임자와 트위스트박스 엔터테인먼트(현재 디지털 터빈)의 최고 운영 책임자 등 주요 리더십 직책을 맡았습니다. 현재 그는 퀵블록스 최고경영자로 활동하고 있으며, 이는 최고의 AI 커뮤니케이션 플랫폼입니다. 그의 업무 경험 외에도, 네이트는 위스컴(Whisk.com), 퍼스트데이 헬스케어(Firstday Healthcare), 테크스타즈(TechStars) 등의 스타트업에서 고문 및 투자자로 활동하고 있습니다. 그는 UC 데이비스와 런던 정치경제대학교(LSE)에서 학위를 취득했습니다.