Intervjuer
Stefan Mesken, Chief Scientist i DeepL – Intervju-serie

Stefan Mesken, Chief Scientist i DeepL, har tilbragt over fem år i DeepL med å utvikle selskapets grunnleggende forskning og vitenskapelige ledelse, fra å begynne som forskningsvitenskapsmann i oktober 2020, til å bli VP for forskning i november 2023, og til slutt til å bli Chief Scientist i april 2025 i München. Før han kom til DeepL, arbeidet han som data scientist i real.digital i Köln-Bonn-regionen og utførte forskning i matematisk logikk ved Universitetet i Münster. Hans karriere spenner over grunnleggende matematisk forskning og anvendt AI, og han er derfor godt posisjonert til å lede den vitenskapelige retningen bak DeepLs store språkmodeller og flerspråklige AI-systemer.
DeepL er et tysk AI-selskap som fokuserer på å bygge avanserte språk-AI-systemer som muliggjør nøyaktig, kontekst-avhengig oversettelse og kommunikasjon på over 100 språk. Selskapet ble grunnlagt i 2017 og har hovedkontor i Köln, og det betjener millioner av brukere verden over og tilbyr bedriftsgraderte løsninger gjennom abonnement og API-tilbud. Plattformen har utvidet seg utover oversettelse til en bredere språk-AI-suiter, inkludert skrivehjelp og talefunksjoner, designet for å støtte sikker, skalerbar kommunikasjon for globale bedrifter og organisasjoner.
Hva var det som førte deg inn i feltet settteori og matematisk logikk, og hvordan har denne tidlige erfaringen påvirket måten du tenker om å bygge autonome, bedriftsgraderte AI-systemer på?
Det som førte meg inn i feltet settteori og matematisk logikk, var en ustopperlig nysgjerrighet etter å lære hvordan disse komplekse systemene fungerer – fra grunnleggende prinsipper og inn i stadig større dybde. Denne nysgjerrigheten har vært en konstant i mitt liv siden barndommen. Det er også det aspektet av mitt arbeid som jeg elsker mest. For tiden er utfordringen å fremme utviklingen av AI med en intens fokus på virkelighetsnær brukbarhet. Forbi sikkerhet og tillit, dedikerer jeg min tid til å sikre at bedrifter og brukere av alle slag kan dra nytte av denne fantastiske teknologien. Så langt, har trenden vært annerledes: De fleste virkelighetsnære AI-bruk er enten fullstendig passive (f.eks. anbefalingsystemer som du konsumerer, men ikke kontrollerer) eller primært brukt av høyt utdannede, tekniske personer (f.eks. kodehjelpere). Jeg vil lukke denne gapen: Hver enkelt og bedrift burde være i stand til å lykkes og kunne revolusjonere måten de arbeider på.
DeepL har bygget sitt rykte på høy-presisjons oversettelse. Hvordan har denne grunnleggende kompetansen i språkmodellering formet selskapets tidlige tenkning om å gå utover oversettelse og inn i mer generelle AI-systemer?
Hva som gjør AI så magisk, er at svært like konsepter og ideer kan føre til nye løsninger i svært forskjellige domener: sjakk-motorer, anbefalingsystemer, protein-folding, selvkjørende biler, oversettelsesmotorer og mange flere. De er alle drevet av samme sett av prinsipper og tekniker. Ved å ha mestret disse teknikkene over nesten et tiår nå, tenker vi naturlig på nye problemer å fokusere på. Internt har dette alltid vært tilfelle, og har ført til oppfinnelsen av Glossary, Write, Voice, Customization Hub og mer.
Som Chief Scientist, hvordan skiller du mellom å bygge språkmodeller som genererer flytende utdata og å bygge systemer som kan pålitelig handle innen virkelige bedriftsarbetsflyter?
De grunnleggende ideene er merkelig like: Vi må forstå i dybden hva våre brukere ønsker, og deretter justere våre AI-systemer med disse målene og preferansene. Noen ganger er de åpenbare og eksplisitte; andre ganger er de nyanserte og uutsagte. I begge tilfeller, er det vår jobb å sikre at arbeidet vi produserer er av høy verdi for våre brukere.
DeepL har alltid stått ut i dette området på grunn av vår fokus på kunden. Vi jakter ikke kunstige benchmark eller akademiske publikasjoner – vi jakter kundetilfredshet. Dette har aldri vært viktigere enn nå, da vi utvider vårt horisont og hjelper mennesker med deres daglige arbeid.
DeepL Agent representerer en skifte fra assistive AI til autonom utførelse. Hva var de største tekniske utfordringene i å gjøre denne overgangen fungere i praksis?
Langt det største tekniske utfordringen i å bygge DeepL Agent, er brukervennlighet. I årevis har AI-økosystemet primært vært rettet mot programvare-utviklere og høyt tekniske eksperter. Med DeepL Agent, ønsker vi å endre dette og utstyre hver kunnskapsarbeider med sofistikerte verktøy for å løse og automatisere komplekse problemer. For å oppnå dette, må vi ha samme nivå av sofistikert gjenkjenning, resonnering, planlegging og handling. I stedet for å presentere brukerne med et rikt, men komplekst sett av verktøy, har vi arbeidet hardt for å skape en sammenhengende, sømløs og elegant løsning for sluttpunkt-støtte og arbeidsflyt-automatisering.
Fra et arkitektonisk perspektiv, hvilke evner må være på plass før et AI-system kan være tillitsfullt til å operere autonomt i bedriftsmiljøer?
For en rekke administrative oppgaver er teknologien allerede her. DeepL Agent kan pålitelig handle i din omgang, søke råd når det er nødvendig, og tilby menneske-i-løkken-verifisering når det er ønskelig. Dette nivå av syntetisk intelligens var ren fiksjon for bare noen måneder siden. Likevel, er det fortsatt en lang vei å gå. Over de neste årene, vil AI-agenter bli et horisontalt lag i bedrifter — ubemerkelig arbeidende i bakgrunnen, samarbeidende med mennesker og hverandre for å eliminere tungt arbeid og gi oss mulighet til å løse problemer som tidligere var utenfor rekkevidde.
Du har snakket om dyp språkforståelse som en forutsetning for ansvarlige AI-agenter. Hva mener du med “dyp” i denne sammenhengen, utover overfladisk flyt?
Språk er merkelig tvetydig og kontekst-avhengig — spesielt i profesjonelle domener. Du har sannsynligvis opplevd dette selv: å høre en gruppe venner diskutere et hobby du ikke deler eller en profesjonell spesialisering du mangler erfaring i… Det kan ikke gjøre mening for utenforstående, men likevel forstår de hverandre perfekt. Vi ønsker at AI-hjelpen skal føles like sømløs som å snakke med en erfaren, pålitelig kollega som du deler år med samarbeid. Implisitte preferanser bør forbli implisitte. Du bør ikke måtte forklare hvordan du ønsker arbeid gjort om og om igjen. Dette kan høres åpenbart ut, men det krever enormt forskning for å få rett. Det er hva jeg mener med “dyp” språkforståelse.
Hvordan nærmer du deg sikkerhet og tilsyn når du deployer autonome systemer som kan ta reelle handlinger, i stedet for bare å gi anbefalinger?
For at AI-hjelpen skal fungere i bedriftssammenheng, må vi nøye balansere evne med kontroll. Større evne skaper enorme muligheter for produktivitet, men hvis den blir uten kontroll, blir den en belastning. Dette kan ikke skje. Fra dag én har DeepL Agent vært utstyrt med bedriftsgraderte sikkerhetstiltak, implementert i flere former. Felles arbeidsområder gir brukerne nøyaktig kontroll over data og tilgang, samtidig som de driver audittspor, menneskelig tilsyn og menneske-i-løkken-verifisering. I tillegg har systemadministratorer finmaskert kontroll over systemene DeepL Agent kan navigere og mekanismer for å varsle underliggende verktøy når de opereres av agenten.
Hva er de viktigste lærdommene du har tilegnet deg om å flytte ideer fra forskning til produksjon uten å ofre pålitelighet eller vitenskapelig disiplin?
Gapet mellom forskning og produktutvikling er bredere enn vanligvis antatt. Begge starter med en rigorøs tilnærming til å løse tidligere uløselige problemer og en nøye registrering av hva som fungerer og hva som ikke gjør det. Mens forskning kan forenkle omfang og anta en enklere verdensmodell, må produktutvikling ta hensyn til kompleksiteten i virkelige brukeres kontekster. I AI-hjelp er verktøysbruk et primært eksempel. Det er fristende å anta at miljøer alltid er forberedt for automatisering, med systemtilgang sorteret og API-er klare. Virkeligheten er annerledes. Like som selvkjørende biler må håndtere full kompleksitet i dagens infrastruktur, må AI-agenter operere effektivt innenfor tilgangsmønster, data og systemer bedrifter avhenger av. Denne tidlige erkjennelsen er i hjertet av DeepL Agents design.
Da DeepL utvider seg fra et fokusert språkplattform til et bredere bedrifts-AI-system, hvordan bestemmer du hvilke evner som bør forbli tett kontrollert og hvilke som bør åpnes for mer autonomt oppførsel?
Nivået av kontroll som kreves for en oppgave, bestemmes av to faktorer: påliteligheten til den menneskelige eller systematiske utførelsen og potensiell innvirkning av feil. Dette gjelder like mye for menneskelig som for maskinell utførelse. AI-påliteligheten har økt massivt over de siste årene og vil fortsette å forbedre seg. Derfor vil tett kontroll være nødvendig for færre og færre oppgaver. Til slutt vil AI-påliteligheten overstige selv menneskelig ekspertnivå for mange oppgaver. Dette gjelder også for kontrollmekanismer, som vil stadig mer skifte over til AI-oversikt. Internt gjør DeepL Agent allerede dette, og ber brukerne om hjelp når selvkorreksjon ikke er mulig.
Ser du fremover, hva er de viktigste gjennombruddene i språkforståelse eller agentdesign som vil forme bedrifts-AI over de neste to årene?
AI-agenter vil ikke bare hjelpe med enkeltoppgaver. De vil danne et samarbeidende produktivitetslag i bedrifter som arbeider på vår vegne for å redusere distraksjoner, forberede og presentere informasjon nøyaktig når det er nødvendig og løse problemer og stadig mer komplekse oppgaver fullstendig i bakgrunnen.
Takk for det flotte intervjuet, lesere som ønsker å lære mer, bør besøke DeepL.












