Модели и платформы ИИ
Системы искусственного интеллекта могут предпочитать человеческий язык вместо числовых данных

Новое исследование из Колумбийского университета предполагает, что системы искусственного интеллекта (ИИ) предпочитают человеческий язык вместо числовых данных, таких как 1 и 0. Это новое исследование было проведено профессором механической инженерии Ходом Липсоном и аспирантом Боюаном Ченом, и оно показало, что системы ИИ могут достигать более высоких уровней производительности, если они запрограммированы с помощью файлов звука человеческого языка.
В сравнении бок о бок исследователи обнаружили, что нейронная сеть, обученная с помощью файлов звука, достигла более высоких уровней производительности при идентификации объектов по сравнению с другой сетью, запрограммированной с помощью простых бинарных входных данных.
Липсон является профессором Джеймса и Салли Скапы по инновациям и членом Института данных Колумбийского университета.
“Чтобы понять, почему это открытие важно, полезно понять, как обычно запрограммированы нейронные сети, и почему использование звука человеческого голоса является радикальным экспериментом”, – сказал он.
Использование бинарных чисел компактно и точно, в то время как человеческий язык более сложен и не бинарен, когда он захвачен в цифровом файле. Программисты обычно не отклоняются от чисел при разработке нейронной сети, поскольку это очень эффективно.
Команда начала это исследование после того, как подумала, что нейронные сети не достигают своего полного потенциала, и они считали, что они могут быть быстрее и лучше, если они будут обучены с помощью человеческого голоса и конкретных слов.
Обучение сетей
Когда исследователи ИИ тестируют новый метод машинного обучения, они часто обучают нейронную сеть распознавать конкретные объекты и животных в коллекции фотографий.
Команда, в которую входили Чен, Липсон, Ю Ли и Сьюзан Рагупати, организовала контролируемый эксперимент, чтобы проверить свою гипотезу, и они создали две новые нейронные сети. Они решили обучить их распознавать 10 разных типов объектов среди 50 000 фотографий, называемых “обучающими изображениями”.
Одна из систем ИИ была обучена более традиционным способом с числовыми значениями, в то время как экспериментальная нейронная сеть была обучена очень по-другому. Ей была предоставлена таблица данных с строками, содержащими фотографию животного или объекта, и второй столбец имел аудиофайл человеческого голоса, который озвучивал слово для животного или объекта. Там не было 1 и 0, связанных с экспериментальной сетью.
Обе системы ИИ были обучены в течение 15 часов. Результаты показали, что исходная сеть ответила серией из 10 1 и 0, в то время как экспериментальная нейронная сеть произвела голос, который был явно пытался “сказать”, какой объект на изображении. Хотя исходный голос был не понятен, он в конечном итоге достиг точки, когда был в основном правильным.
Две сети работали одинаково хорошо, правильно идентифицируя животное или объект 92% времени. Исследователи затем решили запустить эксперимент во второй раз, но на этот раз они использовали меньше фотографий в процессе.
Традиционная сеть работала плохо из-за скудных данных, как и ожидалось, снизившись до примерно 35% точности. Однако экспериментальная сеть работала вдвое лучше, с 70% точности, несмотря на наличие меньших данных.
https://www.youtube.com/watch?v=Iq2YjHCAPRQ
Неожиданные результаты
В следующий раз команда использовала более сложные изображения, такие как поврежденное изображение собаки. Даже с более сложными изображениями нейронная сеть, обученная голосом, была правильной примерно 50% времени, в то время как традиционная сеть была точной только 20% времени.
Боюан Чен является ведущим исследователем в этом исследовании.
“Наши результаты прямо противоречат тому, как многие эксперты были обучены думать о компьютерах и числах; это общее предположение, что бинарные входные данные являются более эффективным способом передачи информации машине, чем аудиопотоки аналогичной информационной насыщенности”, – объяснил Чен. “На самом деле, когда мы представили это исследование на большую конференцию по ИИ, один анонимный рецензент отклонил нашу статью просто потому, что он чувствовал, что наши результаты были слишком удивительными и неинтуитивными”.
“Если вы подумаете о том факте, что человеческий язык проходит процесс оптимизации в течение десятков тысяч лет, то становится совершенно понятно, что наши устные слова нашли хороший баланс между шумом и сигналом”, – сказал Липсон. “Следовательно, когда мы смотрим на это через призму энтропии Шеннона, становится понятно, что нейронная сеть, обученная человеческим языком, превосходит нейронную сеть, обученную простыми 1 и 0”.
Исследование будет представлено на Международной конференции по обучению представлениям 3 мая 2021 года.
“Мы должны подумать о использовании новых и лучших способов обучения систем ИИ вместо сбора более крупных наборов данных”, – сказал Чен. “Если мы переосмыслим, как мы представляем обучающие данные машине, мы могли бы сделать лучше работу как учителя.”
“Одна из самых больших загадок человеческой эволюции – это то, как наши предки приобрели язык, и как дети учатся говорить так легко”, – добавил Липсон. “Если человеческие дети учатся лучше всего с помощью повторяющихся устных инструкций, то, возможно, системы ИИ также могут.”












