Modele i platformy AI

Systemy AI mogą preferować język ludzki zamiast danych numerycznych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badania przeprowadzone przez Columbia Engineering sugerują, że systemy sztucznej inteligencji (AI) preferują język ludzki zamiast danych numerycznych, takich jak 1 i 0. Nowe badanie zostało przeprowadzone przez profesora Hod Lipsona i studenta doktoranckiego Boyuana Chena i wykazało, że systemy AI mogą osiągnąć wyższe poziomy wydajności, jeśli zostaną zaprogramowane przy użyciu plików dźwiękowych języka ludzkiego.

W porównaniu równoległym badacze stwierdzili, że sieć neuronowa szkolona przy użyciu plików dźwiękowych osiągnęła wyższe poziomy wydajności w identyfikowaniu obiektów w porównaniu z siecią zaprogramowaną przy użyciu prostych wejść binarnych.

Lipson jest profesorem inżynierii mechanicznej i członkiem Data Science Institute na Columbia.

„Aby zrozumieć, dlaczego to odkrycie jest znaczące, przydatne jest zrozumienie, w jaki sposób sieci neuronowe są zwykle programowane, oraz dlaczego używanie dźwięku głosu ludzkiego jest radykalnym eksperymentem”, powiedział.

Używanie liczb binarnych jest kompaktowe i precyzyjne, podczas gdy język ludzki jest bardziej złożony i niebinarny, gdy zostanie przechwycony w pliku cyfrowym. Programiści zwykle nie odbiegają od liczb, gdy rozwijają sieć neuronową, ponieważ jest to bardzo wydajne.

Zespół rozpoczął to badanie po tym, jak pomyślał, że sieci neuronowe nie osiągają pełnego potencjału i uwierzył, że mogą być szybsze i lepsze, jeśli zostaną wyszkolone przy użyciu głosu ludzkiego i konkretnych słów.

Szkolenie sieci

Podczas testowania nowej techniki uczenia maszynowego badacze AI często szkolą sieć neuronową, aby rozpoznać określone obiekty i zwierzęta w kolekcji fotografii.

Zespół, w skład którego wchodzili Chen, Lipson, Yu Li i Susan Raghupathi, ustalił kontrolowany eksperyment, aby przetestować swoją hipotezę i stworzył dwie nowe sieci neuronowe. Postanowili je wyszkolić, aby rozpoznać 10 różnych typów obiektów wśród 50 000 fotografii zwanych „obrazami szkoleniowymi”.

Jedna z systemów AI była szkolona w bardziej tradycyjny sposób z wartościami numerycznymi, podczas gdy eksperymentalna sieć neuronowa była szkolona w zupełnie inny sposób. Została nakarmiona tabelą danych z wierszami zawierającymi fotografię zwierzęcia lub obiektu, a w drugiej kolumnie znajdował się plik dźwiękowy głosu ludzkiego, który wypowiadał słowo dla zwierzęcia lub obiektu. Nie było tam 1 i 0.

Obie sieci AI były szkolone przez łączny czas 15 godzin. Wyniki wykazały, że oryginalna sieć odpowiedziała serią dziesięciu 1 i 0, podczas gdy eksperymentalna sieć neuronowa wyprodukowała głos, który wyraźnie próbował „powiedzieć”, co jest obiektem na zdjęciu. Chociaż oryginalny głos nie był zrozumiały, ostatecznie osiągnął punkt, w którym był w większości poprawny.

Obie sieci działały równie dobrze, identyfikując zwierzę lub obiekt poprawnie 92% czasu. Następnie badacze postanowili uruchomić eksperyment po raz drugi, ale tym razem użyli mniej fotografii podczas procesu.

Tradycyjna sieć działała słabo ze względu na ograniczone dane, co było oczekiwane, spadając do około 35% dokładności. Eksperymentalna sieć działała dwa razy lepiej, z 70% dokładnością, pomimo mniejszej ilości danych.

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Zaskakujące wyniki

Następnym razem zespół użył trudniejszych obrazów, takich jak uszkodzony obraz psa. Nawet z tymi trudniejszymi obrazami sieć neuronowa szkolona głosem była poprawna około 50% czasu, podczas gdy tradycyjna sieć była tylko 20% dokładna.

Boyuan Chen jest głównym badaczem w badaniu.

“Nasze wyniki są wprost przeciwne do tego, jak wielu ekspertów było szkolonych, aby myśleć o komputerach i liczbach; jest to powszechne założenie, że dane binarne są bardziej wydajnym sposobem przekazywania informacji do maszyny niż strumienie audio podobnej „bogactwa” “, wyjaśnił Chen. “W rzeczywistości, gdy złożyliśmy to badanie do dużego konferencji AI, jeden anonimowy recenzent odrzucił nasz artykuł po prostu dlatego, że uważał, że nasze wyniki są po prostu „zaskakująco i nieintuicyjne”.

“Jeśli pomyślisz o tym, że język ludzki przechodził przez proces optymalizacji przez dziesiątki tysięcy lat, to ma sens, że nasze wypowiedziane słowa znalazły dobrą równowagę między szumem a sygnałem”, powiedział Lipson. “Dlatego, gdy patrzymy na to przez pryzmat entropii Shannona, ma sens, że sieć neuronowa szkolona językiem ludzkim przewyższa sieć neuronową szkoloną prostymi 1 i 0.”

Badanie zostanie przedstawione na Międzynarodowej Konferencji o Przedstawieniach Uczenia na 3 maja 2021 r.

“Powinniśmy myśleć o używaniu nowych i lepszych sposobów szkolenia systemów AI zamiast zbierania większych zbiorów danych”, powiedział Chen. “Jeśli przemyślimy, w jaki sposób prezentujemy dane szkoleniowe maszynie, możemy lepiej wykonywać swoją pracę jako nauczyciele.”

“Jedną z największych tajemnic ewolucji ludzkiej jest to, w jaki sposób nasi przodkowie zdobyli język i jak dzieci uczą się mówić tak bez wysiłku”, dodaje Lipson. “Jeśli dzieci ludzkie uczą się najlepiej z powtarzającymi się instrukcjami mówionymi, to może systemy AI również mogą.”

Alex McFarland jest dziennikarzem i pisarzem zajmującym się sztuczną inteligencją, który bada najnowsze rozwoje w dziedzinie sztucznej inteligencji. Współpracował z licznymi startupami i wydawnictwami związanymi z sztuczną inteligencją na całym świecie.