AI 모델 및 플랫폼
뇌 임플란트와 AI 모델을 이용한 생각을 텍스트로 번역
캘리포니아 대학교 샌프란시스코의 연구자들은 최근에 뇌 활동을 분석하여 텍스트를 생성할 수 있는 AI 시스템을 개발했습니다. 이는 본질적으로 사람의 생각을 텍스트로 번역하는 것입니다. AI는 사용자의 신경 신호를 해석하고, 30~50개의 문장으로 구성된 집합에서 최대 250개의 단어를 실시간으로 해석할 수 있습니다.
인디펜던트의 보도에 따르면, AI 모델은 4명의 여성으로부터 수집된 신경 신호를 사용하여 훈련되었습니다. 실험에 참여한 참가자들은 뇌에 전극을 삽입하여 간질 발작의 발생을 모니터링했습니다. 참가자들은 문장을 큰 소리로 읽도록 지시받았고, 그들의 신경 신호는 AI 모델에 제공되었습니다. 모델은 특정 단어와 관련된 신경 활동을 식별할 수 있었고, 실제 단어와 일치하는 패턴은 약 97%의 시간에 걸쳐 약 3%의 평균 오류율을 보였습니다.
이것은 처음으로 신경 신호가 문장과 관련되어 있음을 보여주는 연구는 아닙니다. 신경과학자들은 지난 10년 동안 유사한 프로젝트에 대해 작업해 왔습니다. 그러나 연구자들이 개발한 AI 모델은 인상적인 정확도를 보이고 거의 실시간으로 작동합니다. 모델은 재귀 신경망을 사용하여 신경 활동을 단어로 번역할 수 있는 표현으로 인코딩합니다. 저자들은 그들의 논문에서 다음과 같이 말합니다.
“최근 기계 번역의 진보에서 영감을 얻어, 우리는 재귀 신경망을 훈련시켜 각 문장 길이의 신경 활동 시퀀스를 추상적인 표현으로 인코딩하고, 그 다음에 단어 단위로 영어 문장으로 디코딩했습니다.”
ArsTechnica에 따르면, 연구자들은 시스템이 신경 신호와 단어를 연결하는 방법을 더 잘 이해하기 위해 시스템의 다양한 부분을 비활성화하는 실험을 수행했습니다. 시스템의 정확도는 신경 표현에 기인한다는 것이 명백했습니다. 또한 오디오 입력을 비활성화하면 오류가 증가하지만, 전체 성능은 여전히 신뢰할 수 있었습니다. 이는 시스템이 말할 수 없는 사람들을 위한 장치로 потен적으로 유용할 수 있음을 의미합니다.
전극 입력의 다양한 부분을 비활성화하면, 시스템은 주로 음성 처리와 생성과 관련된 특정 뇌 영역에 주목했습니다. 예를 들어, 시스템의 성능의 상당한 부분은 음성 생성과 관련된 뇌 영역에 기인했습니다.
초기 결과는 आश망을 주지만, 연구 팀은 모델이 더 큰 어휘에 대해 얼마나 잘 확장할 수 있는지 불확실합니다. 원리는 더 큰 어휘에 일반화될 수 있어야 합니다. 평균 영어 사용자는 약 20,000개의 활성 어휘를 가지고 있습니다. 현재 디코더 방법은 문장의 정적 구조를 해석하고, 특정 신경 활동 패턴에 해당하는 단어에 대한 교육된 추측을 사용합니다. 어휘가 증가하면, 더 많은 신경 패턴이 유사해질 수 있으므로 전체 정확도가 낮아질 수 있습니다.
논문의 저자들은 디코더가 언젠가 언어의 규칙적이고 신뢰할 수 있는 패턴을 식별하는 방법을 배우기를 희망하지만, 일반적인 영어 언어에 일반화할 수 있는 모델을 훈련시키기 위해 필요한 데이터의 양은 불확실합니다. 이 문제를 해결하는 한 가지 방법은 다른 알고리즘과 임플란트를 사용하는 뇌-컴퓨터 인터페이스에서 수집된 데이터로 훈련을 보충하는 것입니다.
캘리포니아 대학교의 연구자들이 수행한 연구는 신경 인터페이스와 컴퓨터에 관한 연구 및 개발의 증가하는 물결의 최근 발전입니다. 로열 소사이어티는 지난 해에 신경 인터페이스가 컴퓨터와 사람을 연결하여 사람們이 서로의 생각을 읽을 수 있게 할 것이라고 예측하는 보고서를 발표했습니다. 이 보고서는 엘론 머스크가 창립한 Neuralink 스타트업과 페이스북에서 개발된 기술을 인용하여, 인간 중심 컴퓨팅의 향상된 발전에 대한 증거로引用합니다. 로열 소사이어티는 인간-컴퓨터 인터페이스가 다음 2십년 동안 알츠하이머와 같은 신경 퇴행성 질환의 치료에 강력한 옵션이 될 것이라고 언급합니다.












