KI-Modelle und Plattformen
Dr. Neil Yager, Mitgründer und Chief Scientist von Phrasee – Interview-Serie

Dr. Neil Yager ist der Chief Scientist von Phrasee und der Architekt der Phrasee-Methode, eines künstlichen Intelligenz-gestützten Copywriting-Tools, das dazu beigetragen hat, Marketing-Texte für einige der weltweit bekanntesten Marken zu optimieren, darunter eBay, Groupon und Virgin – sowie viele weitere, von Australien bis Amerika, in über 20 Sprachen, von Englisch bis Japanisch.
Dr. Yager hat über ein Dutzend akademischer Veröffentlichungen verfasst, ein Buch über Data-Mining geschrieben und hält mehrere Patente. Als einer der weltweit führenden Experten für die Kommerzialisierung von künstlicher Intelligenz hält er einen PhD in Informatik von der University of New South Wales in Australien.
Sie sind ein 20-jähriger Veteran der Technologiebranche, welche AI-bezogenen Rollen hatten Sie vorher inne?
Ich bin seit meinem PhD in den mittleren 2000er Jahren in AI-bezogener Arbeit tätig. Allerdings hat sich das Feld seitdem mehrmals umbenannt. Zum Beispiel habe ich vor 15 Jahren “statistische Mustererkennung” studiert. Einige Jahre später war dies als “Machine Learning” bekannt, was ein viel fesselnderer Name ist. In den letzten Jahren ist Machine Learning (und insbesondere “Deep Learning”) synonym mit “künstlicher Intelligenz” im Allgemeinen geworden. Ich habe gemischte Gefühle darüber. Einerseits hat mich meine Arbeit bei Phrasee gelehrt, wie wichtig Branding ist. Andererseits bringt der Begriff “künstliche Intelligenz” Gepäck mit sich und kann zu Missverständnissen über die Technologie führen. Ich frage mich, wo wir wären, wenn wir alle noch “statistische Mustererkennung” sagen würden.
Die meisten meiner vorherigen Arbeiten waren in den Bereichen Signalverarbeitung und Computer-Vision. Ich hatte nicht viel Erfahrung mit Natural Language Processing vor Phrasee. Ich habe seitdem gelernt, dass Sprache wahrscheinlich das schwierigste Problem in der künstlichen Intelligenz ist.
Im Jahr 2008 haben Sie ein Buch mit dem Titel ‘Biometric System and Data Analysis: Design, Evaluation, and Data Mining‘ co-verfasst, das Aspekte der Statistik und des Machine Learning verbindet, um eine umfassende Anleitung zur Bewertung, Interpretation und zum Verständnis von biometrischen Daten zu bieten. Abgesehen von mehr Rechenressourcen, glauben Sie, dass sich dieses Feld seit der Veröffentlichung des Buches entwickelt hat? Können Sie beschreiben, wie?
Deep Learning hat die Bereiche Computer-Vision, Sprachverarbeitung und Machine Learning seitdem ich das Buch geschrieben habe, revolutioniert. Es wäre nicht möglich, dieses Buch heute ohne ein Kapitel über Deep Learning zu schreiben.
Die Deep-Learning-Revolution begann wirklich 2012, als ein Deep-Learning-Modell den Wettbewerb ImageNet gewann. ImageNet ist ein visuelles Objekterkennungs-Datensatz, bei dem der Computer bestimmt, was in einem Bild ist (z.B. “Hund” oder “Ballon”). Für Jahrzehnte haben Forscher kleine Fortschritte auf Benchmark-Datensätzen wie diesem gemacht. Jedes Teilgebiet arbeitete unabhängig und verließ sich stark auf domänen-spezifische Expertise. Fast über Nacht wurden alle Modelle, die über viele Jahre sorgfältig aufgebaut worden waren, veraltet. Deep-Learning-Algorithmen, die von Außenstehenden entworfen wurden, gewannen Wettbewerbe mit deutlichen Margen. Dies veränderte die AI-Industrie.
Das Feld bewegt sich noch immer schnell und hat sich sogar seit der Gründung von Phrasee vor einigen Jahren weiterentwickelt. Zum Beispiel existierten die Deep-Learning-Tools, auf die wir jetzt angewiesen sind, nicht, als wir das Unternehmen gründeten. Der Innovationsprozess bringt seine eigenen Herausforderungen mit sich.
Können Sie uns mitteilen, was Phrasee für Unternehmen leisten kann?
Phrasee löst zwei Probleme für Unternehmen. Erstens gibt es das Problem des Schreibens von Marketing-Texten. Es gibt mehr Werbekanäle als je zuvor (z.B. E-Mail, AdWords, Social-Media, Print, Podcasts usw.). Es ist schwierig, Texte für all diese Kanäle zu schreiben, die von hoher Qualität sind und dem Markenstil und der Tonalität entsprechen. Phrasee löst das Skalierungsproblem, indem es Texte automatisch generiert. Zweitens ist es wichtig, dass alle verwendeten Sprachen effektiv sind. Phrasee generiert nicht nur Sprache, sondern verwendet auch Machine Learning, um die Auswirkungen der Botschaften vorherzusagen und entsprechend zu optimieren.
Was hat Sie dazu bewogen, Natural Language Processing (NLP) und Deep Learning zu verwenden, um die Kraft von Werbetexten zu verbessern?
Die Verwendung von künstlicher Intelligenz, um die Auswirkungen von Online-Marketing-Kampagnen zu maximieren, ist keine neue Idee. Es gibt Teams von Menschen mit PhDs in Physik, die für die Optimierung von Werbung rekrutiert wurden. Allerdings konzentrieren sich die meisten Teams auf Dinge wie Zielgruppensegmentierung, Personalisierung, Zeitplanung, Werbeplatzierung, Schriftarten usw. Als wir mit Phrasee begannen, bemerkten wir, dass fast alles über Werbung optimiert wird, außer der tatsächlichen Sprache, die verwendet wird! Wir identifizierten dies als eine Lücke im Markt und eine enorme Chance.
Phrasee kann Marketing-Texte in über 20 Sprachen verbessern, darunter Japanisch. Können Sie einige der einzigartigen NLP-Probleme erörtern, die bei Fremdsprachen auftreten?
Die neueste Ergänzung unserer unterstützten Sprachen ist Russisch. Dies ist eine slawische Sprache und unterscheidet sich deutlich von anderen indogermanischen Sprachen. In diesem Fall mussten wir neue Regeln in unser Sprachgenerierungssystem einbauen, damit die Ausgabe flüssig und grammatisch korrekt ist. Dies ist nicht nur ein Sprachproblem, sondern auch ein Software-Entwicklungsproblem. Wenn die Ausgabe unseres Systems in der Muttersprache des Entwicklers ist, ist es relativ einfach, Fehler zu erkennen und zu überprüfen, ob alles korrekt funktioniert. Wenn wir jedoch an Russisch oder Japanisch arbeiten, könnten wir Unsinn produzieren und haben keine Ahnung. Es ist wichtig, einen Muttersprachler eng in den QA-Prozess einzubinden.
Die Herausforderung besteht nicht nur bei Fremdsprachen. Es gibt auch interessante regionale Unterschiede. Zum Beispiel gibt es bei Englisch Schreibvarianten für die USA, Großbritannien, Australien, Kanada usw. Es gibt auch grammatische Unterschiede. Im britischen Englisch “sieht man sich um”, während man im amerikanischen Englisch “eine Aussicht nimmt”. Die Bedeutung von Wörtern kann auch von Ort zu Ort variieren. Ein “Gummi” ist ein Radiergummi in Großbritannien, aber ein Kondom in Nordamerika! Damit NLG-Systeme für Geschäftsanwendungen verwendet werden können, müssen sie all diese Feinheiten berücksichtigen.
Können Sie uns einige Details darüber mitteilen, wie Deep Learning in Phrasee eingesetzt wird?
Es gibt zwei Haupt-AI-Komponenten in Phrasees Technologie. Die erste ist Natural Language Generation (NLG), die tatsächlich Sprache produziert. Die zweite ist Deep Learning, und der Fokus liegt hier auf Leistung. Leistung kann je nach Kontext unterschiedliche Dinge bedeuten. Zum Beispiel ist das Ziel einer E-Mail-Betreffzeile, den Empfänger dazu zu bringen, die E-Mail zu öffnen und den Inhalt zu sehen. Für Facebook (META ) kann das Ziel darin bestehen, Likes oder Shares zu maximieren. Wenn man große Mengen an historischen Daten hat, kann man feine Trends und Muster finden, die von einem Menschen nie bemerkt würden. Dies ist ein Standard-Machine-Learning-Problem.
Deep Learning bietet einige Vorteile gegenüber dem herkömmlichen Machine-Learning-Ansatz. Bei herkömmlichem Machine Learning liegt der Fokus auf “Feature-Engineering”. Das bedeutet, dass der Entwickler entscheiden muss, welche Merkmale der Sprache am wichtigsten sind. Zum Beispiel Wörter, Länge, Emoji-Verwendung usw. Das Problem ist, dass dies durch die Fähigkeiten und die Vorstellungskraft des Ingenieurs begrenzt ist. Bei Deep Learning wird der rohe Text in das Modell eingegeben, und es baut seine eigene maschinelle Repräsentation von Sprache auf (dies wird als End-to-End-Lernen bezeichnet). Daher ist es frei von menschlicher Voreingenommenheit und ist ein leistungsfähiger Ansatz. Allerdings ist es schwierig, zu verstehen, warum das Modell sich so verhält, wie es tut. “Erklärbarkeit” ist ein aktives Forschungsgebiet innerhalb der Deep-Learning-Community. Es gibt jedoch einen grundlegenden Kompromiss zwischen der Komplexität eines Systems und unserer Fähigkeit, es zu verstehen. Menschliche Sprache ist chaotisch, daher haben erfolgreiche NLP-Lösungen typischerweise einen hohen Grad an Komplexität.
Eine der Funktionalitäten von Phrasee ist die Fähigkeit, in einem einzigartigen Ton einer Marke zu schreiben. Können Sie erläutern, wie dies funktioniert?
Wenn wir einen neuen Kunden aufnehmen, sammeln wir zunächst Informationen über den Kommunikationsstil der Marke. Dazu gehören alle formalen Markenrichtlinien, historische Marketing-Kampagnen und eine Reihe von Fragebögen, die wir für diesen Zweck entwickelt haben. All diese Informationen werden von einem internen Team von Sprachtechnikern verwendet, um ein kunden-spezifisches “Sprachmodell” zu erstellen. Unsere Sprachmodelle sind generativ, was bedeutet, dass sie nie zuvor gesehene Sprache im einzigartigen Stil eines Kunden produzieren können.
Die Sprachmodelle können jederzeit aktualisiert werden. Zum Beispiel sind wir derzeit auf dem Höhepunkt der COVID-19-Krise. Unser Sprachteam überprüft unsere Modelle, um sicherzustellen, dass unangemessene Sprache nicht erstellt werden kann. Ein Ausdruck wie “Diese Deals sind viral!” wäre vor einigen Monaten harmlos gewesen, ist aber jetzt offensichtlich unangemessen. Dies zeigt die Flexibilität unseres Systems.
Welche Art von Daten benötigt ein Unternehmen, das mit Phrasee beginnen möchte?
Um ehrlich zu sein, benötigt man nicht viel Daten, um mit uns zu beginnen. Der erste Schritt besteht darin, ein geeignetes Projektgebiet zu identifizieren. Zum Beispiel könnte dies die Betreffzeilen für wöchentliche Promotion-E-Mails sein. Idealweise sollte dies ein relativ großes Publikum haben und regelmäßige Kommunikation. Sobald das Projekt identifiziert ist, benötigen wir Informationen über das beabsichtigte Thema und den Markenton, um das Sprachmodell zu erstellen. Phrasee benötigt Leistungsdaten auf kontinuierlicher Basis. Da unsere Lösung Machine Learning verwendet, ist es wichtig, dass wir wichtige Metriken im Laufe der Zeit messen und verfolgen. Diese Informationen werden in unser System eingespeist, damit es kontinuierlich für Engagement optimiert werden kann.
Gibt es noch etwas, das Sie über Phrasee teilen möchten?
Als Parry, Victoria und ich Phrasee vor fünf Jahren gründeten, waren wir sicher, dass es nur eine Frage der Zeit wäre, bis viele andere Start-ups mit ähnlichen Produkten auftauchen würden. Unser Plan war, den Wettbewerbern einen Schritt voraus zu sein und einen Vorsprung zu halten. Wir wurden jedoch überrascht von der geringen Zahl von Wettbewerbern in diesem Bereich. Wo sind alle anderen? Ich denke, es gibt mehrere Gründe dafür, aber einer der Hauptgründe ist, dass Sprache so ein schwieriges Problem ist. Ich vermute, dass andere versucht haben, ähnliche Produkte zu erstellen, aber früh in der Entwicklungsphase gescheitert sind. Dies ist ein Zeichen dafür, wie einzigartig unsere Technologie ist.
Vielen Dank für das informative Interview über Natural Language Processing, Natural Language Generation und Deep Learning. Um mehr zu erfahren, können Besucher Phrasee besuchen.












