Andersons Blickwinkel
Ein Machine-Learning-System, um einen Artikel während des Lesens umzuschreiben

Neue Forschung aus Kanada schlägt eine Methode vor, um einen Artikel automatisch während des Lesens umzuschreiben, basierend auf Tinder-ähnlichem “Swipen” oder auf passiver Beobachtung der Interaktion des Lesers mit den verschiedenen Arten von Inhalten, die der Artikel enthält.
Das System, das Hone As You Read (HARE) heißt, wird in einem Paper von der Western University in Ontario, Kanada, vorgestellt, mit entsprechendem Python-Code auf GitHub.
Die zentrale Idee des Projekts ist, dass ein Artikel verschiedene Arten von Inhalten enthalten kann, die sich (ähnlich wie dieser) von der Überschrift bis hin zu weiteren Details entwickeln. Spätere Teile eines Artikels können unterschiedliche Arten von unterstützenden Materialien, Anwendungsfälle oder Hypothesen oder Vermutungen über die Auswirkungen der Nachricht enthalten.
Unter HARE können Sie, wenn Sie solche Materialien nicht mögen, es auf einer Absatz-basierten Grundlage abwählen, während das System Ihre Vorlieben lernt, so dass, wenn Sie nach unten scrollen, Inhalt, der dem Material ähnelt, das Sie “abgewählt” haben, bereits entfernt oder umgeschrieben wurde. Wenn Sie nicht aktiv am Training des Systems teilnehmen möchten, kann HARE Ihre Auswahl durch Beobachtung Ihrer passiven Interaktionen mit dem Dokument ableiten.
Tinder-ähnliches Abstimmen für unangenehme Sätze
In dem Bild unten sehen wir drei mögliche Arten von abgeleiteter Kategorisierung für HARE, basierend auf dem expliziten oder impliziten Verhalten des Benutzers. Im ersten Fall (links) wählt der Benutzer aktiv “nach links” (oder rechts), in einer Tinder-ähnlichen Abstimmungsgeste, die Zustimmung oder Unzufriedenheit mit dem Inhalt des Absatzes oder Satzes, oder mit seinem Stil, seiner Komplexität oder seinem Ton, ausdrückt.
Im zweiten Fall (Mitte) verwendet das System die Verweildauer als Maß für das Benutzerinteresse, basierend auf der Positionierung und Dauer der Scrollpause.
Im dritten Fall (rechts) verwendet HARE die Smartphone-Kamera, um den Pfad und die Verweildauer der Blickposition des Betrachters über die Absätze des sichtbaren Dokuments zu schätzen.
Die Forscher behaupten, dass eine längere Verweildauer auf einem Absatz ein erhöhtes Benutzerinteresse anzeigen kann, obwohl dies logischerweise nicht der Fall ist, wenn der Betrachter versucht, Text zu assimilieren, der kompliziert oder schlecht geschrieben sein kann.

Benutzerfeedback bearbeitet, schreibt um oder löscht noch nicht gesehene Teile des Artikels effektiv.
Inhalte vorverarbeiten, um sie den Benutzervorlieben anzupassen
Die Arbeit beschäftigt sich mit der Benutzererfahrung von HARE auf pro-Artikel-Basis, aber offensichtlich ermöglicht die historische Interaktion des Benutzers mit Dokumenten die Anpassung zukünftiger Leseerfahrungen, indem sie konsistent Arten von Inhalten erkennt und vordefinierte Benutzervorlieben auf neue Artikel anwendet, so dass die Notwendigkeit der Interaktion abnimmt, wenn der Benutzer weniger und weniger “unerwünschten” Inhalt sieht.
HARE wird als Summarizer-Algorithmus charakterisiert, der es ermöglicht, noch nicht sichtbaren Inhalt weiter unten auf der Seite in Bezug auf Stil oder Kürze umzuschreiben, bevor der Benutzer ihn erreicht; aber die Arbeit macht deutlich, dass es auch vorbeugend Inhalt basierend auf Benutzerfeedback entfernen kann.
Zu Testzwecken verwendete das System einen Korpus von 11.222 Artikeln aus der britischen Daily Mail-Zeitung und wurde durch eine Testbereitstellung auf der Telegram-Chat-App ausgewertet. Artikel mit weniger als zehn Absätzen wurden für Testzwecke verworfen.

Die Telegram-HARE-App in einer Testphase mit Benutzern.
Die Methodik der Forscher verwendet K-Means-Clustering auf SBERT-Satz-Einbettungen in den Artikeln, mit anfänglich zufälligen Gewichten für Konzepte.
Unter einer breiten Gruppe von Algorithmen und Ansätzen verfügt HARE über drei Vergleichsmodelle, von denen das erste (ORACLEGREEDY) Zugriff auf vorherige Benutzervorlieben hat, was darauf hindeutet, dass der Algorithmus Artikel vor dem Laden vorverarbeiten könnte, anstatt interaktiv zu sein.
Die anderen Modelle, ORACLESORTED und ORACLEUNIFORM, wählen Sätze basierend auf dem Interessenniveau oder zufällig im gesamten Artikel aus.
Inhaltsentfernung und -umschreibung
Überraschenderweise übertraf ORACLEUNIFORM die Kontrollgruppe, obwohl es keinen Zugriff auf vorherige Benutzerinteressen hat. Die Forscher behaupten, dass dies daran liegt, dass es den gesamten Artikel in einem Durchgang bearbeitet, “nur die interessantesten Sätze auswählt”. Die Forscher geben zu, dass dies den verfügbaren Inhalt auf Sätze beschränken kann, die sich ausschließlich mit dem wichtigsten Konzept befassen, und logischerweise andere Texte, die sich mit den Auswirkungen oder der Bewertung des Konzepts befassen, entfernen kann.
Die in HARE verwendeten extraktiven Summarizer sind LexRank, SumBasic und TextRank.
HARE wurde an 13 Freiwilligen über einen Zeitraum von 70 Versuchen und verschiedenen algorithmischen Ansätzen getestet und konnte Zusammenfassungen (umgeschriebener oder ausgeschnittener Text) in einer Zeit zwischen 1,3 Millisekunden und 100 ms auf einem Consumer-Grade-Laptop aktualisieren, je nachdem, welches Modell getestet wurde. Die Ergebnisse zeigten, dass die Modelle, die den meisten Text entfernten, nicht gut abschnitten, hauptsächlich weil dies die Kohärenz des verbleibenden Textes beeinträchtigen kann.
Ethische Auswirkungen der dynamischen Artikelumschreibung
Die Forscher erkennen ethische Bedenken hinsichtlich Technologien dieser Art an:
‘Die HARE-Aufgabe ist für die Gestaltung zukünftiger benutzerorientierter Anwendungen gedacht. Durch Design haben diese Anwendungen die Fähigkeit, zu kontrollieren, was ein Benutzer aus einem bestimmten Artikel liest. Es ist möglich, dass, wenn diese Tools ohne ausreichende Sorgfalt eingesetzt werden, sie den “Echo-Kammer”-Effekt verschlimmern, der bereits durch automatisierte Nachrichten-Feeds, Suchergebnisse und Online-Communities erzeugt wird.’
Jedoch weisen sie auch darauf hin, dass ein solches System in zukünftigen Anwendungen verwendet werden könnte, um den Echo-Kammer-Effekt zu mildern, indem es Texte einfügt, die alternative Standpunkte vorschlagen, die möglicherweise nicht ursprünglich im Artikel vorhanden waren. Sie bemerken: ‘Die Gewichtung dieses Faktors könnte so eingestellt werden, dass er sowohl ein ansprechendes Leseerlebnis als auch die Exposition gegenüber einer Vielzahl von Ideen bietet.’
Diejenigen, die wahrscheinlich von einem solchen System profitieren, sind Leser, die Zeit sparen möchten, wenn sie Informationen aufnehmen, und Content-Verleger.
in dem Artikel. Sie bemerken: ‘Die Gewichtung dieses Faktors könnte so eingestellt werden, dass er sowohl ein ansprechendes Leseerlebnis als auch die Exposition gegenüber einer Vielzahl von Ideen bietet.’
Diejenigen, die wahrscheinlich von einem solchen System profitieren, sind Leser, die Zeit sparen möchten, wenn sie Informationen aufnehmen, und Content-Verleger.













