Modely a platformy AI

Systémy umělé inteligence možná preferují lidský jazyk místo číselných dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nový výzkum z Columbia Engineering naznačuje, že systémy umělé inteligence (AI) preferují lidský jazyk místo číselných dat jako 1 a 0. Nová studie je od profesora mechanického inženýrství Hod Lipsona a doktoranda Boyuana Chena a ukázala, že systémy AI mohou dosáhnout vyšších úrovní výkonu, pokud jsou programovány pomocí zvukových souborů lidského jazyka.

Ve srovnávacím experimentu vědci zjistili, že neuronová síť trénovaná pomocí zvukových souborů dosáhla vyšších úrovní výkonu při identifikaci objektů ve srovnání s druhou sítí, která byla programována pomocí jednoduchých binárních vstupů.

Lipson je profesor inovace Jamese a Sally Scapy a člen Data Science Institute na Kolumbijské univerzitě.

“Chcete-li pochopit, proč je toto zjištění významné, je užitečné pochopit, jak jsou neuronové sítě obvykle programovány, a proč použití lidského hlasu je radikální experiment,” řekl.

Používání binárních čísel je kompaktní a přesné, zatímco lidský jazyk je složitější a nebinární, pokud je zachycen v digitálním souboru. Programátoři obvykle se odchylují od čísel při vývoji neuronové sítě, protože je to vysoce efektivní.

Tým se pustil do tohoto výzkumu poté, co si myslel, že neuronové sítě nedosahují svého plného potenciálu, a věřili, že by mohly být rychlejší a lepší, pokud by byly trénovány pomocí lidského hlasu a konkrétních slov.

Trénování sítí

Při testování nové techniky strojového učení často trénují výzkumníci AI neuronovou síť, aby rozpoznala konkrétní objekty a zvířata v kolekci fotografií.

Tým, který zahrnoval Chena, Lipsona, Yu Li a Susan Raghupathi, nastavil kontrolovaný experiment, aby otestoval svou hypotézu, a vytvořil dvě nové neuronové sítě. Chtěli trénovat sítě, aby rozpoznaly 10 různých typů objektů mezi 50 000 fotografiemi nazvanými “trénovacími obrázky”.

Jedna ze systémů AI byla trénována tradičním způsobem pomocí numerických hodnot, zatímco experimentální neuronová síť byla trénována velmi odlišně. Byla krmena datovou tabulkou s řádky obsahujícími fotografii zvířete nebo objektu a druhým sloupcem obsahujícím zvukový soubor lidského hlasu, který vyslovoval slovo pro zvíře nebo objekt. Nebyly zde zapojeny žádné 1 a 0.

Obě sítě byly trénovány po dobu 15 hodin. Výsledky ukázaly, že původní síť odpověděla sérií deseti 1 a 0, zatímco experimentální neuronová síť produkovala hlas, který se snažil “říci”, co je objekt na obrázku. Zatímco původní hlas nebyl srozumitelný, nakonec dosáhl bodu, kdy byl většinou správný.

Obě sítě fungovaly stejně dobře, identifikovaly zvíře nebo objekt správně 92 % času. Výzkumníci se poté rozhodli provést experiment podruhé, ale tentokrát použili méně fotografií během procesu.

Tradiční síť fungovala špatně kvůli nedostatku dat, jak se očekávalo, a klesla na asi 35% přesnosti. Experimentální síť však fungovala dvakrát lépe, s 70% přesností, přestože měla méně dat.

https://www.youtube.com/watch?v=Iq2YjHCAPRQ

 

Překvapivé výsledky

Příště tým použil obtížnější obrázky, jako je poškozený obrázek psa. I s obtížnějšími obrázky byla síť trénovaná hlasem správná asi 50 % času, zatímco tradiční síť byla správná pouze 20 % času.

Boyuan Chen je hlavní výzkumník studie.

“Naše zjištění jdou přímo proti tomu, jak mnoho odborníků bylo vycvičeno myslet na počítače a čísla; je to běžné předpoklad, že binární vstupy jsou efektivnějším způsobem, jak přenést informace do stroje, než audio proudy podobné ‘bohatosti’,” vysvětlil Chen. “Ve skutečnosti, když jsme tuto studii předložili na velkou konferenci AI, jeden anonymní recenzent odmítl náš článek prostě proto, že cítil, že naše výsledky jsou ‘příliš překvapivé a neintuitivní’.”

“Pokud si uvědomíte, že lidský jazyk prošel procesem optimalizace po desetitisíce let, pak to dává smysl, že naše mluvená slova našla dobrý rovnováhu mezi šumem a signálem,” řekl Lipson. “Proto, když se na to díváme skrze čočku Shannonovy entropie, dává to smysl, že neuronová síť trénovaná lidským jazykem by překonala síť trénovanou pomocí jednoduchých 1 a 0.”

Studie bude prezentována na Mezinárodní konferenci o učících se reprezentacích 3. května 2021.

“Měli bychom uvažovat o používání nových a lepších způsobů, jak trénovat systémy AI, místo sbírání větších datových sad,” řekl Chen. “Pokud přehodnotíme, jak prezentujeme trénovací data stroji, mohli bychom udělat lepší práci jako učitelé.”

“Jedna z největších záhad lidské evoluce je, jak naši předkové získali jazyk, a jak děti se učí mluvit tak snadno,” dodal Lipson. “Pokud lidské batolata se učí nejlépe s repetitivními mluvenými instrukcemi, pak možná systémy AI mohou také.”

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.