Ángulo de Anderson
Un sistema de aprendizaje automático para reescribir un artículo mientras lo lee

Nueva investigación de Canadá propone un método para reescribir automáticamente un artículo mientras se lee, basado en un estilo de ‘deslizamiento’ similar a Tinder, o en la observación pasiva de la interacción del lector con los diferentes tipos de contenido que el artículo contiene.
El sistema, titulado Hone As You Read (HARE), se presenta en un documento de la Universidad de Western en Ontario, Canadá, con código Python correspondiente en GitHub.
La idea central del proyecto es que un artículo puede contener varios tipos de contenido, que evoluciona (al igual que este) desde el titular hasta los detalles adicionales. Las partes posteriores de un artículo pueden contener material de apoyo diferente, casos de uso o hipótesis o conjeturas sobre las ramificaciones de la noticia.
Bajo HARE, si no te gusta ese tipo de material, puedes votarlo mientras el sistema aprende tus preferencias, de modo que cuando desplazas la página, el contenido similar al material que ‘votaste en contra’ ya ha sido eliminado o reescrito. Si no deseas participar activamente en la capacitación del sistema, HARE puede deducir tus elecciones observando tus interacciones pasivas con el documento.
Votación al estilo de Tinder para oraciones desagradables
En la imagen a continuación, vemos tres tipos posibles de categorización inferida para HARE, basados en el comportamiento explícito o implícito del usuario. En el primer caso (izquierda), el usuario ‘desliza hacia la izquierda’ (o hacia la derecha), en un gesto de votación al estilo de Tinder que expresa aprobación o desaprobación del contenido de la oración o párrafo, o de su estilo, complejidad o tono.
En el segundo caso (centro), el sistema utiliza el tiempo de permanencia como una métrica del interés del usuario, basada en la posición y duración de la pausa de desplazamiento.
En el tercer caso (derecha), HARE utiliza la cámara del teléfono inteligente para estimar la trayectoria y el tiempo de permanencia de la ubicación de la mirada del espectador a través de los párrafos del documento visible.
Los investigadores sostienen que el aumento del tiempo de permanencia en cualquier párrafo puede indicar un mayor interés del usuario, aunque lógicamente esto no puede ser el caso cuando el espectador intenta asimilar texto que puede ser complicado o simplemente mal escrito.

La retroalimentación del usuario edita, reescribe o borra por completo secciones del artículo que aún no se han visto.
Preprocesamiento de contenido según las preferencias del usuario
El documento se ocupa de la experiencia del usuario con HARE en una base por artículo, pero claramente la interacción histórica del usuario con los documentos permite la personalización de futuras experiencias de lectura, al reconocer consistentemente tipos de contenido y aplicar preferencias del usuario templadas a nuevos artículos, de modo que la necesidad de interacción disminuye a medida que el usuario ve menos y menos ‘contenido no deseado’.
HARE se caracteriza como un algoritmo de resumen, que permite que el contenido no visto más abajo de la página se reescriba en términos de estilo o concisión antes de que el usuario llegue a él; pero el documento deja claro que también puede eliminar contenido de antemano según la retroalimentación del usuario.
Con fines de prueba, el sistema utilizó un corpus de 11,222 artículos del periódico Daily Mail del Reino Unido, y se evaluó a través de una prueba de implementación en la aplicación de chat de Telegram. Se descartaron artículos con menos de diez párrafos para fines de prueba.

La aplicación de Telegram HARE en una fase de prueba con usuarios.
La metodología de los investigadores utiliza K-Means clustering en SBERT embeddings de oraciones en los artículos, con pesos inicialmente aleatorios para conceptos tratados.
Entre una amplia variedad de algoritmos y enfoques, HARE cuenta con tres modelos de comparación, el primero de los cuales (ORACLEGREEDY) tiene acceso a preferencias de usuario anteriores, lo que indica la intención de que el algoritmo pueda preprocesar artículos al cargarlos, en lugar de interactuar con ellos.
Los otros modelos, ORACLESORTED y ORACLEUNIFORM, seleccionan oraciones según el nivel de interés o aleatoriamente en todo el artículo, respectivamente.
Eliminación y reescritura de contenido
Sorprendentemente, ORACLEUNIFORM superó al conjunto de control, a pesar de que no tiene acceso a intereses de usuario anteriores. Los investigadores sostienen que esto se debe a que se ocupa del artículo completo en un solo movimiento, ‘seleccionando solo las oraciones más interesantes’. Los investigadores admiten que esto puede restringir el contenido disponible a aquellas oraciones que se ocupan únicamente del concepto más importante, lógicamente eliminando otro texto que puede tratar de las ramificaciones o la evaluación del concepto.
Los resumidores extractivos utilizados en HARE son LexRank, SumBasic y TextRank.
HARE se probó en 13 voluntarios durante 70 pruebas y diferentes enfoques algorítmicos, y pudo actualizar resúmenes (texto reescrito/eliminado) en algún lugar entre 1,3 milisegundos y 100 ms en una laptop de consumo, dependiendo del modelo que se probara. Los resultados encontraron que los modelos que eliminaron la mayor cantidad de texto no funcionaron bien, principalmente porque esto puede afectar la coherencia del texto restante.
Implicaciones éticas de la reescritura dinámica de artículos
Los investigadores reconocen preocupaciones éticas en torno a tecnologías de este tipo:
‘La tarea HARE está destinada al diseño de aplicaciones de cara al usuario. Por diseño, estas aplicaciones tienen la capacidad de controlar lo que un usuario lee de un artículo determinado. Es posible que, cuando se implementen sin el debido cuidado, estas herramientas puedan exacerbar el efecto “cámara de eco” ya producido por las fuentes de noticias automatizadas, los resultados de búsqueda y las comunidades en línea.’
Sin embargo, también señalan que dicho sistema podría utilizarse en aplicaciones futuras para mitigar el efecto de cámara de eco al inyectar texto que propone puntos de vista alternativos que pueden no haber estado presentes inicialmente en el artículo. Observan: ‘El peso de este factor podría ajustarse para proporcionar una experiencia de lectura atractiva y exposición a una diversidad de ideas.’
Los que probablemente se beneficien de dicho sistema, según los investigadores, son los lectores que desean ahorrar tiempo al recibir información y los editores de contenido.
en el artículo. Observan: ‘El peso de este factor podría ajustarse para proporcionar una experiencia de lectura atractiva y exposición a una diversidad de ideas.’
Los que probablemente se beneficien de dicho sistema, según los investigadores, son los lectores que desean ahorrar tiempo al recibir información y los editores de contenido.













