Haastattelut
Dani Cherkassky, Kardomen toimitusjohtaja ja perustaja – Haastattelusarja

Dani Cherkassky, Kardomen toimitusjohtaja ja perustaja, tuo yli kaksikymmentä vuotta akustiikkaan, signaalinkäsittelyyn ja algoritmien kehitykseen liittyvää kokemusta ääniteknologian innovaatioiden eturintamaan. Ennen Kardomen perustamista hän toimi Silentium Ltd.:n teknisenä johtajana, jossa hän johti tutkimus- ja kehitysyhteistyötä Tier 1 -yritysten ja tutkimuslaitosten kanssa. Bar-Ilanin yliopistosta saatuaan tohtorin tutkinnon mikrofonimatriisien käsittelystä, Cherkassky yhdistää syvän teknisen asiantuntemuksen selkeään tehtävään — poistamaan modernin ääniviestinnän frustraatiot luomalla teknologiaa, joka todella kuuntelee ihmisiä, ei ympäröivää melua.
Kardome on uranuurtaja älykkäissä tilaäänenratkaisuissa, jotka tarjoavat selkeät, henkilökohtaiset ääniviestintätapaamiset missä tahansa ympäristössä — autoista ja konferenssisaleista älykkäisiin kotiin ja julkisiin tiloihin. Sen omistama puhesyhdistysteknologia erottaa äänet sijainnin perusteella, mahdollistaen laitteiden ymmärtää kunkin puhujan kuin he olisivat ainoat puhujat. Suunniteltu olemassa olevan laitteiston kanssa toimivaksi ja reunan valmiiksi, Kardomen alusta parantaa puheentunnistuksen tarkkuutta, turvallisuutta ja käyttökokemusta, voimassa olevan seuraavan sukupolven ihmiskoneviestintää.
Mikä innoitti sinua ja tohtori Alon Slapakia perustamaan Kardomen?
Innoitus Kardomelle kasvoi yhdistelmästä fascinaatiota ja frustraatiota. Taustamme puheessa ja audiossa, sekä akateemisessa maailmassa että teollisuudessa, me olimme innoostuneita edistymisestä puheentunnistuksessa, erityisesti kun syvät neuroniverkot tulivat kuvioon.
Hiljaisessa laboratoriossa teknologia oli upea. Mutta heti kun astuit oikeaan maailmaan, se magia katosi. Havaitsemme, että meluisassa autossa, kiireisessä toimistossa tai kaoottisessa kodissa, edistykselliset, kehittyneet järjestelmät olivat vain hieman parempia kuin 1990-luvun teknologia. Tämä oli suuri este edistymiselle.
Ääni on luonnollisin tapa vuorovaikuttaa laitteiden kanssa, oikea seuraaja kosketusnäytölle. Mutta tämän toteutumiseksi teknologian on voitettava elämän kaaos. Päätimme tehdä siitä tehtävämme. Vietimme vuoden garaasissa painien äaaltojen etenemisen kaavoja ja testaten uusia ideoita, kunnes saavutimme läpimurron: ensimmäinen demonstroidaan sitä, mitä nyt tunnetaan Kardomen tilaäänen teknologiana.
Sillassa tiesimme, että meillä oli avain. Perustimme Kardomen ei vain rakentamaan tuotetta, vaan aloittamaan vallankumouksen siinä, miten ihmiset ja koneet viestivät.
Monet ääniohjaimet kamppailevat ja ärsyttävät usein käyttäjiä, kun äänet menevät ristiin tai taustamelu ottaa yli. Miksi perinteiset menetelmät suoriutuvat niin huonosti näissä oikean maailman olosuhteissa?
Perinteiset äänikäyttöliittymät suoriutuvat huonosti oikeassa maailmassa, koska niiden ohjelmisto perustuu liian yksinkertaiseen menetelmään äänen ymmärtämiseksi. Useimmat järjestelmät käyttävät useita mikrofoneja määrittämään äänen saapumissuuntaa, lähestymistapaa, joka keskittyy vain äänen kulmaan ja jättää huomiotta muun tärkeän 3D-avaruudellisen tiedon. Tämä menetelmä epäonnistuu välittömästi missä tahansa oikean maailman asetelmissa — kuten autossa, toimistossa tai olohuoneessa — koska nämä ympäristöt ovat täynnä heijastuksia, missä äänet heijastuvat jokaisesta heijastuspinnoitteesta. Järjestelmälle, joka ymmärtää vain suunnan, jokainen näistä heijastuksista näkyy uutena äänenä eri sijainnista.
Tämä luo hämmentävän vaikutuksen, aivan kuin laite olisi “akustisten peilien” salissa, jossa yksi ääni tulee satojen suuntien yhtä aikaa. Kykenemättömänä erottamaan erillisiä puhujien ääniä ääniMaisemasta, järjestelmä ei voi oikein dekoodata ääniä. Tämä perusrajoitus on tarkalleen se, miksi nykyiset ääniteknologiat ovat niin huonoja havainnoimassa ääniä oikean maailman kaoottisissa tilanteissa ja lopulta epäonnistuvat toimimasta luotettavasti.
Kardomen teknologiat käsittelevät jokaista henkilöä kuin he olisivat ainoat puhujat huoneessa. Mikä on tekninen läpimurto, joka mahdollistaa tämän, ja miten se eroaa perinteisestä etäältä kuullusta äänentunnistuksesta?
Meidän tekninen läpimurto on omistama teknologia, jota kutsutaan tilaääneksi, joka ylittää perinteiset menetelmät, jotka vain havaitsevat äänen suunnan, ja sen sijaan määrittää äänen tarkan sijainnin kolmiulotteisessa avaruudessa. Se toimii analysoimalla koko heijastuskuviota, jonka ääni luo huoneessa, ja käsittää monimutkaisen äänen heijastumisen yksilölliseksi “akustiseksi sormenjäljeksi” kyseiselle sijainnille. Meidän älykäs järjestelmä havaitsee tämän sormenjäljen välittömästi ja passiivisesti jokaiselle äänilähteelle, ja kartoittaa tehokkaasti ympäristön. Tämä sijaintiperusteinen lähestymistapa on perustavanlaatuinen ero perinteisiin suuntaa ohjaaviin järjestelmiin, jotka hämmentyvät helposti heijastuksista, joita me käytämme arvokkaana datana. Kun he kuulevat yhden puhujan kuin joukon kaikua, meidän teknologiamme käyttää koko heijastuskuviota määrittämään todellisen lähteen. Käytännön tuloksena on, että Kardome-käyttöinen laite voi keskittyä yhteen henkilöön meluisassa ympäristössä ja kuulla heidät kuin he puhuisivat yksin hiljaisessa huoneessa. Lisäksi, kognitiivinen äly varmistaa, että järjestelmä ei vain kuule sanoja, vaan ymmärtää myös, kuka puhuu ja mitä he tarkoittavat asiayhteydessä.
Älyääni sanotaan olevan “iPhonen hetkensä”. Mitä se tarkoittaa sinun näkökulmasta, ja miten lähellä olemme älyäänen laajamittaista omaksumista?
Minulle “iPhonen hetki” tarkoittaa, että ääni on vihdoin valmis tulemaan oletusarvoiseksi tavaksi, jolla vuorovaikutamme laskentalaitteiden kanssa.
Näen valmistajia kilpailemassa älyääniteknologian integroimisessa koko tuotelinjaansa. Autot muuttuvat ääniohjatuiksi käyttöliittymiksi turvallisuuden vuoksi. Älykkäät kodit tarvitsevat äänikäyttöliittymiä, koska ei ole mahdollista asettaa kosketusnäyttöjä joka paikkaan. Perinteinen elektroniikka lisää myös äänitoimintoja, koska se on usein nopeampaa kuin valikoiden navigointi. Vaikka monet teknologiat ajavat äänen omaksumista, todellinen vallankumous määräytyy robottiikan mukaan. Kun robotit integroidaan kodeissamme ja työpaikoillamme, ääni nousee ainoaksi todella tehokkaaksi ja luonnolliseksi vuorovaikutusliittymäksi.
TTämän yhteentörmäyksen ollessa vaivattoman, robotit on ymmärrettävä meitä inhimillisellä tasolla. Heidän on ymmärrettävä asiayhteys ja puheen nuansseja, eivätkä vain avainsanoja. He tarvitsevat tilallista tietoisuutta, joka on niin tarkka, että se tuntuu maagiselta — vaistomaisesti tietäen, että sinä puhut heille, jopa meluisassa huoneessa. Kriittisesti, tämä äly on toimiva reunalla välittömäksi, yksityiseksi ja luotettavaksi viestinnäksi.
Tämä ei ole asteittainen parannus; se on perustavanlaatuinen muutos siinä, miten ihmiset ja koneet vuorovaikuttavat. Me rakennamme teknologiaa, joka johtaa tämän uudelleenmäärittelyn. Arvioin, että olemme noin 24 kuukauden päässä käänteentekevää hetkestä, jossa ääni tulee odotetuksi käyttöliittymäksi eikä vain mukavaa ominaisuutta.
Mitä tapahtuu kuluttajien suhteessa ääniohjaimiin, kun tarkkuus ja luotettavuus meluisissa ympäristöissä ratkaistaan?
Kun luotettavuus ja luonnollinen keskustelu ratkaistaan, ääniohjaimet siirtyvät uutuudesta välttämättömiksi käyttöliittymiksi, joista ihmiset riippuvat päivittäin. Kun ihmiset tietävät, että älyääni ymmärtää heidät oikein ensimmäisellä kerralla, jopa haastavissa ympäristöissä, he lopettavat mukauttamisen teknologian mukaan ja alkavat käyttää sitä vaistomaisesti luonnollisella kielellä ja asiayhteyksellisillä keskusteluilla.
Tulevaisuuden ääniviestintä on ennakkoivaa ja proaktiivista. Kuvittele laitetta, joka ymmärtää äänesi, tunnelmasi, emotionaalisia vihjeitäsi ja keskustelun alituisuutta. Nykyiset järjestelmät kamppailevat keskustelun luonnollisen rytmin kanssa eivätkä voi käsitellä keskeytyksiä, vuoropuhelua ja asiayhteyden ymmärtämistä. Ihmiset sopeutuvat, kun heidät keskeytetään; älyääni usein hämmentyy. Laitevalmistajille haaste on integroida älyääni, joka voi toimittaa tämän tulevaisuuden käyttöliittymän ilman nykyisten ratkaisujen monimutkaisuutta ja laitteiston vaatimuksia.
Lopulta, mitä näet Kardomelle ja älyääni-ekosysteemille viiden vuoden kuluttua, ja mitkä ovat merkittävimmät merkkipaalut, jotka määrittävät, olemmeko todella siirtymässä ääniohjatun laskennan aikakauteen?
Viiden vuoden kuluttua älyääni on yhtä yleistä kuin kosketusnäytöt ja näppäimistöt tänään, ja se on odotettavissa lähes jokaisessa laskentalaitteessa. Kardome on käyttöjärjestelmä, joka mahdollistaa laitteiden käytön äänellä, mahdollistaen luonnollisen vuorovaikutuksen minkä tahansa laitteen kanssa minkä tahansa ympäristössä — robotiikasta älylasien ja autojen kautta.
Merkittävimmät merkkipaalut ovat käyttäytymiseen liittyviä eikä teknologisia. Tiedämme, että olemme saavuttaneet ääniohjatun laskennan, kun ihmiset lopettavat ajattelemisen äänikomennoista ja alkavat käydä luonnollisia keskusteluja ympäristönsä kanssa, kun monen käyttäjän ympäristöt toimivat vaivattomasti, ja kun lapset kasvavat odottaen puhuvansa luonnollisesti minkä tahansa laitteen kanssa. Lopullinen mittapuun on ei se, miten kehittyneitä teknologiamme tulevat olemaan, vaan miten luonnollisesti ihmiset vuorovaikuttavat digitaalisen maailman kanssa.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla Kardomessa.












