AI-mallit ja alustat

Microsoft julkaisee MAI-Transcribe-2-Streaming -mallin sekä kaksi MAI-Voice -mallia

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Microsoft AI julkaisi 1. lokakuuta 2026 julkaisi MAI-Transcribe-2-Streaming, ensimmäisen suoratoisto‑transkriptio‑mallinsa, sekä kaksi uutta tekstistä puheeksi -mallia, MAI-Voice-2.1 ja MAI-Voice-2.1-Flash, jotka kaikki ovat saatavilla Microsoft Foundryn kautta.

MAI-Transcribe-2-Streaming ja Artificial Analysis -vertailu

Microsoft kuvaa MAI-Transcribe-2-Streamingia tarjoavan matalan viiveen reaaliaikaiset transkriptiot 60 kielessä automaattisella, jatkuvalla kielentunnistuksella. Yritys kertoi, että malli on tarkkuudessa ykkönen sekä lopullisissa että osittaisissa transkriptioissa Artificial Analysis -testissä, ja että se sijoittuu vertailun tarkkuus‑vs‑viive‑arvioinnin Pareto‑rajalle, mikä tarkoittaa, että tarkkuuden parantaminen ei vaadi suurta viivekompromissia. Julkaisun johtotaulukko, jossa viitataan Artificial Analysis -suoratoisto‑johtotaulukkoon 28. syyskuuta 2026, näyttää mallin 2,5 prosenttia lopullisen sanavirheraten, 2,8 prosenttia ensimmäisen osittaisen virheraten ja 0,13 sekuntia lopulliseen transkriptioon.

Sen sijaan, että odotettaisiin puhujan puheen päättymistä ennen tekstin palauttamista, malli tuottaa ensimmäiset hypoteesinsa, joita kutsutaan osittaisiksi, hieman yli 100 millisekunnin kuluessa äänen vastaanottamisesta, ja tarkentaa niitä, kun lisää kontekstia saapuu, ennen kuin se sitoutuu vakaaseen transkriptioon. Microsoft kertoi, että tämä mahdollistaa puhetta hyödyntävien sovellusten toimia puheen aikana ennen puhujan lopettamista: äänibotit voivat aloittaa päättelyn tai työkalujen kutsumisen lauseen keskellä, ja reaaliaikaiset transkriptiot voivat näkyä ihmisten puhuessa. Reaaliaikaisessa sanakirjauksessa ja tekstityksessä yritys sanoi sisäisten arviointien osoittavan sanojen ilmestyvän transkriptioon kaksinkertaisella nopeudella verrattuna lähimpään kilpailijaan.

Artificial Analysis sanoo että sen AA-WER Streaming -indeksi mittaa transkription tarkkuutta malleille, joissa ääni suoratoistetaan reaaliaikaisesti, paloittain, noin kahdeksan tunnin äänen yli kolmesta aineistosta: AA-AgentTalk 50 prosenttia, VoxPopuli 25 prosenttia ja Earnings22 25 prosenttia. Aineistot kattavat todellisen puheen erilaisilla aksenteilla, toimialakohtaisella kielellä ja haastavilla akustisilla olosuhteilla, ja vertailun Time to Final- ja Time to First Partial -mittaukset alkavat molemmat puheen lopun jälkeen, jonka SileroVAD-äänitoiminnan tunnistin havaitsee.

MAI-Transcribe-2-Streaming on saatavilla aloitushintana $0.54 per ääni‑tunti vuoden loppuun asti. Malli laajentaa Microsoftin MAI‑äänituotetta, johon kuuluu jo MAI-Transcribe-2, aiempi ei‑suoratoisto‑puheentunnistusmalli, jonka yritys väitti olevan maailman nopein, tarkin ja edullisin.

MAI-Voice-2.1 ja MAI-Voice-2.1-Flash

MAI-Voice-2.1 tukee 23 kieltä ja 26 lokaalia, ja Microsoft kertoi, että yksi ääni voi käyttää kaikkia niitä natiivisaksenteella, säilyttäen puhujan identiteetin kielten vaihdon aikana. Yrityksen esittämässä esimerkkisovelluksessa tutorointisovellus voi vaihtaa kieltä oppitunnin aikana ilman opettajan vaihtamista, ja monikielinen avustaja voi vastata millä tahansa kielellä, johon se osoitetaan, säilyttäen silti saman äänen. Mallin hinta on $22 per 1M merkkiä.

MAI-Voice-2.1-Flash tukee samoja kieliä ja monikielisiä puhujia, mutta se on suunniteltu suurta volyymia ja viiveherkkiä kuormia varten. Se voi tuottaa enintään 45 sekuntia ääntä 150 millisekunnin kokonaisviiveellä, ja Microsoft kertoi sen tarjoavan 55 prosenttia nopeamman mallin inferenssin ja olevan noin 60 prosenttia edullisempi kuin vastaavat mallit. Sen hinta on $15 per 1M merkkiä.

Molemmat äänimallit tukevat äänikloonausta kaikilla tuetuilla kielillä käyttäen muutaman sekunnin referenssiääntä, ja Microsoft kertoi sisäänrakennettujen suostumusrajoitusten estävän väärinkäytön. 4 000 kuuntelijan Turing‑testissä, jossa yhdistettiin kaksi uutta äänimallia, 50,3 prosenttia kuuntelijoista arvioi MAI-Voice‑mallin yhtä tai enemmän ihmiselle muistuttavaksi kuin ihmisen äänitteet, Microsoft kertoi.

Microsoft esitti MAI-Transcribe-2-Streamingin ja MAI-Voice-2.1-Flashin yhdistämisen ajankäytön takaisinostona ääni‑agenttisilmukan molemmilla puolilla, eli kuuntelun, ymmärtämisen, päätöksenteon ja puhumisen vaiheessa, jonka aikana ihminen kokee vuorovaikutuksen edelleen keskusteluna. Listatut kehittäjien käyttötapaukset sisältävät asiakaspalveluagentit, jotka transkriboivat pyynnöt puheen aikana ja vastaavat luonnollisella puheella, monikieliset avustajat, jotka tunnistavat puhutun kielen ja vastaavat millä tahansa 23 tuetusta MAI-Voice‑kielestä, sekä interaktiiviset oppimis- ja mediäsovellukset, jotka käyttävät eri puhujia tutorointiin, roolipelaamiseen, simulaatioihin, kerrontaan ja keskustelusisältöön.

Saatavuus ja Chatter‑demo

MAI-Voice-2.1 ja MAI-Voice-2.1-Flash ovat saatavilla OpenRouterin kautta. Kaikki kolme mallia ovat saatavilla Microsoft Foundryn, MAI Playgroundin, Vercelin ja Azure Voice Live -palvelun kautta, ja LiveKit on listattu tulossa pian.

Näyttääkseen mallien toimivan yhdessä live‑agentissa, Microsoft rakensi Chatterin, uuden demon MAI Playgroundissa, jonka avulla käyttäjät voivat puhua ääniavustajalle, jota ohjaavat transkriptio‑ ja äänimallit.

Jonas Reeve on AI‑luotu analyytikko Unite.AI:ssa, keskittyen kognitiiviseen tekoälyyn, yleiseen tekoälyyn (AGI) ja koneälyn teoreettisiin perusteisiin. Hänen työnsä tutkii, miten oppiminen, päättely, muisti ja abstraktio syntyvät sekä biologisissa että keinotekoisissa järjestelmissä, ja luo yhteyksiä nykyaikaisten tekoälyarkkitehtuurien ja kognitiivisen tieteen sekä mielenfilosofian pitkään kestäneisiin kysymyksiin.

Käsitteellisellä ja pohdiskelevalla lähestymistavalla Jonas tarkastelee kehyksiä, kuten päättelymalleja, agenttijärjestelmiä, emergenttiä kognitiota ja sovitus-teoriaa, pyrkien selventämään, mitä edistyminen kohti AGI:ta todella merkitsee – ja mitä se ei merkitse. Sen sijaan, että hän jahdataisiin aikatauluja tai hypeä, hän korostaa perusperiaatteita, käsitteellistä tarkkuutta ja nykyisten mallien rajoja.

Jonas Reeven kirjoittamat artikkelit ovat AI‑luotuja ja Unite.AI:n toimituskunta tarkistaa ne varmistaakseen tarkkuuden, selkeyden ja vastuullisen keskustelun kehittyneistä tekoälykäsitteistä.