AI-modeller og plattformer
Alexander Hudek, medgrunnlegger og CTO i Kira Systems – Intervju-serie

Alex Hudek er medgrunnlegger og CTO i Kira Systems. Han har Ph.D og M.Math grader i datavitenskap fra University of Waterloo, og en B.Sc. fra University of Toronto i fysikk og datavitenskap.
Hans tidligere forskning innen bioinformatikk fokuserte på å finne likheter mellom DNA-sekvenser. Han har også arbeidet innen områdene bevis-systemer og database-spørringssammenslåing.
Når ble du først interessert i maskinlæring og AI?
Jeg har alltid vært interessert i datavitenskap. I studietiden tok jeg kurs i algoritmer for planlegging og logikk, maskinlæring og AI, numerisk regning og andre emner. Min interesse for maskinlæring økte mer spesifikt under min Ph.D. ved University of Waterloo. Der brukte jeg maskinlæring-metoder til å studere DNA. Etterpå dykket jeg dyptere inn i formelle logikker som en del av min postdoktorale forskning. Logikk og resonnering er på noen måter den “andre siden” av mynten i tilnærminger til AI, og jeg følte det var viktig å vite mer om det.
Noen av dine tidligere forskningsarbeider innen bioinformatikk fokuserte på å finne likheter mellom DNA-sekvenser. Kan du diskutere noe av dette arbeidet?
Hoveddelen av min avhandling bestod i å bygge en mer realistisk modell for DNA-mutasjon ved hjelp av skjulte Markov-modeller. Jeg brukte denne mer komplekse modellen i en ny algoritme designet til å finne regioner av DNA som deler felles opphav med andre arter. Spesifikt kan denne nye algoritmen finne mye svakere relaterte sekvensområder enn tidligere algoritmer for oppgaven.
Før min Ph.D. arbeidet jeg i en forskningslab som var en del av det menneskelige genoom-prosjektet. En av de mest bemerkelsesverdige prosjektene jeg hjalp til å fullføre, var den første komplette utkastet til det menneskelige kromosom 7.
Hva var den opprinnelige inspirasjonen bak lanseringen av Kira?
Idéen til Kira kom fra min medgrunnlegger, Noah Waisberg. Han hadde brukt timer i sin karriere som advokat på å gjøre den type arbeid vi nå har bygget AI til å gjøre. Det var en interessant idé for meg, fordi det involverte naturlig språk, og problemet var godt avgrenset, og jeg kunne se forretningspotensialet. Det er noe tiltrekkende ved å bygge AI som kan forstå menneskelig språk, fordi språk er så nært knyttet til menneskelig kognition.
Kan du beskrive hva kontraktanalyse-programvare er og hvordan det kan nyttiggjøre seg for juridiske fagfolk?
Kira bruker overvåket maskinlæring, det vil si at en erfaren advokat matet inn bestemmelser fra virkelige kontrakter inn i et system designet til å lære fra disse eksemplene. Systemet studerer denne dataen, lærer hva språk er relevant, og bygger sannsynlighetsmodeller for bestemmelser. Modellene testes deretter mot en sett med annoterte avtaler som systemet ikke er kjent med, for å bestemme dens beredskap. Denne høyaktige maskinlæringsteknologien kan identifisere og analysere nesten hvilken som helst bestemmelse i hvilken som helst kontrakt, med kunderrapporterte tidsspar på 20-90%. Denne økte produktiviteten hjelper advokatfirmaer med å øke deres realiseringsrater, gir dem mer mulighet til å øke inntekten og bevare eksisterende kunder. For bedrifter driver det bedre produktivitet internt, og reduserer mengden eksternt juridisk utgifter som kreves.
Naturlig språkbehandling (NLP) er vanskelig for de fleste selskaper. Kan du diskutere noen av de ekstra utfordringene som oppstår når det gjelder å behandle juridisk terminologi og andre nyanser som er unike for den juridiske profesjonen?
For mange mennesker kan juridisk språk synes svært fremmed, men det viser seg at det fra et maskinlæring-perspektiv ikke er så forskjellig. Det er noen få unike ting; stor skrift er viktigere, og setninger kan være mye lengre enn vanlig, men ellers har vi ikke behøvd vesentlig forskjellige NLP-tilnærminger enn i andre domener.
En aspekt som er vesentlig forskjellig er behovet for datavern og tilpasning. Juridiske fagfolk er pålagt å holde klientdata konfidensielt, og å bruke det i et maskinlæring-produkt som samler eller deler treningdata, er i strid med disse kravene. Faktisk er det ofte ikke mulig å beholde treningdata, da de har plikter til å slette klientdata etter at et prosjekt er avsluttet. Derfor er det kritisk å kunne trene modeller uten at leverandører er involvert, samt å bruke maskinlæringsteknikker som gjør det vanskelig eller umulig å gjenopprette noen del av treningdata ved å inspisere lært modeller. Teknikker som gjør det mulig å ta en eksisterende modell og oppdatere den med nye treningdata uten å måtte trene fra scratch, er også et måtte-ha.
Kan du beskrive hvordan dyptlæring brukes til å kategorisere data innen Kira-programvaren?
Vi bruker ikke mye dyptlæring i vårt produkt, selv om vårt interne forskningsteam tilbringer mye tid på å evaluere og undersøke dyptlæring-løsninger. Hittil har dyptlæringsteknikker bare matchet ikke-dyptlæring-tilnærminger, eller fått en svært liten økning. Gitt den enorme beregnings-overhodet til dyptlæring-metodologier, samt utfordringer med å holde treningdata privat, har de ikke vært overbevisende nok til å bli adoptert ennå.
Hva er noen av de innebygde bestemmelsesmodellene som Kira tilbyr?
Kira kan identifisere og trekke ut over 1 000 innebygde bestemmelser, klausuler og datapunkter (smart felt). De relatere til en mengde forskjellige emner, fra M&A Due Diligence – som Kira opprinnelig ble konseptualisert til å hjelpe med – til Brexit; til eiendom. De smarte feltene er bygget av vårt team av fagfolk som inkluderer erfaren advokater og regnskapsførere. Med vår maskinlæringsteknologi, krever Kira-standardene at nesten hvert smart felt oppnår en minimum av 90% gjentakelse, hvilket betyr at vårt programvare vil finne 90% eller mer av bestemmelsen, klausulen eller datapunktet du spesifikt søker etter i dine kontrakter eller dokumenter, og redusere risiko og feil i kontraktgjennomgangsprosessen. I tillegg kan et ubegrenset antall tilpassede felt skapes/læres av et firma for å automatisk identifisere og trekke ut relevante innsikter ved hjelp av vårt Quick Study-verktøy.
Den juridiske verden er ofte kjent for å være seig til å adoptere ny teknologi. Finner du at det finnes en utdanningshindre når det gjelder å utdanne advokatfirmaer?
Advokater liker virkelig å vite hvordan ting fungerer, så utdanning er viktig. Det er ikke hardest å undervise advokater om maskinlæring og AI enn andre fagfolk, men det er definitivt nødvendig å ha treningsmateriell klart. Mange av adopsjons-hindringer er også sosiale; mennesker spør ofte om beste praksis i å tilpasse deres interne prosesser til å bruke AI, eller er interessert i hvordan de kan bruke AI til å endre deres forretnings-tilbud på en måte som gir dem fordeler utover bare effisiens-forbedringer.
Er det noe annet du ville like å dele om Kira?
Akademisk litteratur og åpne kildekode-biblioteker for maskinlæring var instrumental i å hjelpe oss å starte selskapet. Vi tror at åpen informasjon og programvare er en enorm fordel for verden. I lys av dette, er jeg spesielt glad for at vårt forskningsteam publiserer resultater fra mange av våre forskningsinnsats i akademiske tidsskrifter og konferanser. Bortsett fra å demonstrere at vi presser grensene for nåværende kunnskapsnivå, lar dette oss gi tilbake til samfunnene som hjalp oss å starte, og som vi fortsatt får en mengde verdi fra. Du kan finne våre papirer på https://kirasystems.com/science/.
For å lære mer, besøk Kira Systems.












