Thursday, May 9, 2013

Discovering Similar User Models Based on Interest Tree

La comparación de intereses entre dos modelos de usuario se lleva a cabo tradicionalmente sobre una serie de vectores. Sin embargo, recientemente los modelos de usuario se expresan mediante una estructura de árbol por lo que las medidas tradicionales de comparación no se adaptan por completo. El artículo propone una forma de llevar a cabo la comparación entre las estructuras de árbol de los modelos de usuario.

El modelo de usuario basado en árboles contiene la siguiente información:

  • Tema de interés del usuario
  • Grado de interés en distintos temas
  • Relaciones jerárquicas entre los temas de interés

La siguiente figura es un ejemplo de un árbol de interes.

image

Se llevan a cabo varios tipos de cálculos para comparar los intereses de dos usuarios, el primero es el cálculo de similitud de la estructura. El cálculo de similitud en la estructura de nodos se refiere a las diferencias en la estructura entre los modelos de usuario. Para determinar esto se toman en cuenta los siguientes tres casos:

  1. Similitud estructural del nodo hoja
  2. Similitud estructural entre el nodo hoja y los nodos que no son hojas
  3. Similitud estructural entre los nodos que no son hojas

El segundo cálculo que se lleva a cabo es sobre la similitud de tema de interés. Ya que no sólo se conocen los intereses del usuario sino también el grado con el que están relacionados al usuario, se lleva a cabo la comparación entre los valores de dos usuarios. El valor es originalmente determinado por el comportamiento y tiempo de navegación sobre el elemento.

Se lleva a cabo otro cálculo que se denomina como similitud comprensiva. Esta es la suma de las similitudes anteriores multiplicadas por un peso.

Los experimentos se llevan a cabo sobre 10 modelos usuarios y a su vez sobre 10 temas de interés. Para desplegar los resultados, sólo se incluyeron a 3 modelos que se despliegan a continuación:

image

image

image

image

Como conclusiones proponen que su medida comprensiva (CIS) muestra resultados más reales que usar las dos medidas de manera separada. Sin embargo no se sabe contra que están comparadas estas similitudes para validar el tipo de cálculos que llevan a cabo.

Zhang, L., Zhang, B., Zheng, J., Weng, X., Wang, M., & Mei, K. (2012). Discovering Similar User Models Based on Interest Tree. 2012 IEEE 12th International Conference on Computer and Information Technology (pp. 1046–1050). Ieee. doi:10.1109/CIT.2012.214

Fluid User Models for Personalized Mobile Apps

Se presenta una manera de construir y administrar los modelos de usuario durante su interacción con los medios. Debido a la escasez de información, en varias aplicaciones se han empleado suposiciones que ayudan a poblar el modelo de usuario como lo son:

  • Si dos usuarios han mostrado un mismo interés, es posible que con cierta probabilidad compartan un grado de interés en el futuro.
  • Si a un usuario le agrada un objeto, es probable que le agrade un objeto razonablemente similar en un futuro.

La investigación presentada se centra sobre el problema de media augmentation. Como ejemplo se da un video que se muestra en una pantalla y en otra se dan detalles sobre lo que aparece en la primera. La siguiente figura es una ilustración de este proceso:

image

Según algunos de los estudios citados por el artículo, las personas no pueden predecir su propio comportamiento. Debido a esto, si el sistema debe predecir lo que el usuario quiere escuchar en un lugar y tiempo determinados, se debe llevar a cabo en tiempo real sobre diversas fuentes de información. Esto es debido a que en muchos casos, el significado, la relevancia y el valor intrínseco de interés por algún fragmento de un medio es una función de interpretación hecha por el usuario a la hora de verlo.

Que el modelo se le considere altamente fluido es el resultado de inferir las preferencias del usuario en tiempo real sobre una serie de variables que incluyen el nivel de atención, contexto y la historia reciente.

La siguiente figura muestra la arquitectura del sistema propuesto:

image

El sistema monitorea y computa la atención del usuario basado en reglas de inferencia y otras entradas como su nivel de multi-tareas, su actividades durante los días anteriores, etc. También se calcula el nivel de interés que presente en distintos contenidos en diversos puntos en el tiempo y otros más son calculados empleando la historia reciente del usuario y sus actividades.

El sistema decide qué cosas son las que interesan al usuario y el tiempo apropiado en que deben ser mostradas en base al contenido del material que se encuentra viendo. La siguiente tabla es una muestra de los datos y las descripciones del material en base a los que se llevan a cabo las decisiones de mostrar o no las anotaciones:

image

El artículo se encuentra basado en un trabajo en progreso y falta más detalle sobre los métodos con los que obtuvieron la información.

Loeb, S. (2013). Fluid user models for personalized mobile apps Overview of the BrightNotesTM system. 2013 IEEE 10th Consumer Communications and Networking Conference (CCNC) (pp. 705–708). Ieee. doi:10.1109/CCNC.2013.6488530

Friday, May 3, 2013

A Framework for Personalized Management of Domain Ontologies

Las ontologías de dominio son una representación formal del conocimiento. Debido a su popularidad y reusabilidad, aumentan su tamaño constantemente para incluir todos los conceptos correspondientes a su dominio. Sin embargo, no todas las aplicaciones requieren acceso a la ontología completa sino sólo a partes de ella. En el artículo se propone una personalización de la ontología dependiendo del uso que se requiere.

Para lograr dividir una ontología se debe hacer de acuerdo a su similitud semántica y se deben detectar y resolver la heterogeneidad. Las ontologías pueden ser divididas en módulos gracias a su representación como grafos, rompiendo los enlaces entre los nodos. Sin embargo, se menciona que los módulos resultantes siguen siendo de un tamaño demasiado grandes.

La siguiente figura muestra la arquitectura propuesta:

image

El modelo consiste en emplear las técnicas de descomposición en módulos para la ontología de dominio y luego en tiempo de ejecución elegir dinámicamente los módulos que requiere el usuario y se le brinda una vista personalizada.

Con el modelo se pueden representar los intereses del usuario que además suelen cambiar conforme al tiempo. En la implementación se emplea un modelo de distancia de declive para modelar los intereses personalizados de un usuario por medio de etiquetas en una línea de tiempo. Las etiquetas recientes tienen una mayor probabilidad de ser usadas por el usuario que las que llevan un tiempo en el sitio, es por esto que las recientes tienen un declive menor a las antiguas.

La creación de vistas personalizadas se muestra en la siguiente figura:

image

Primero se lleva a cabo la descomposición de acuerdo a su nivel de conectividad procurando crear módulos con alta cohesión. Después, según las características del usuario se lleva a cabo una selección de los módulos. Se detecta si existe heterogeneidad entre los módulos, se juzga si son suficientes para el usuario y si se encuentran incompletos. El último paso consiste en combinar los módulos para presentar la vista personalizada.

Liu, R., Wang, P., & Zheng, S. (2012). A Framework for Personalized Management of Domain Ontologies. 2012 IEEE/ACIS 11th International Conference on Computer and Information Science (pp. 411–415). Ieee. doi:10.1109/ICIS.2012.6

Proposal of User Modeling Method and Recommender System based on Personal Values

El valor de juicio de un usuario se refiere al criterio para juzgar en qué atributos se enfoca el usuario al evaluar los objetos. El método propuesto en el artículo no evalúa las preferencias sino la relación entre el rating de cada atributo y los objetos. Esto permite encontrar el atributo que contribuye mayormente al rating de un objeto.

Los modelos de usuario son generados basados en la tasa de influencia de los ratings de cada atributo hacia los ratings de los objetos. La influencia está definida por el RMRate (Rating Machine Rate). Mientras mayor RMRate tenga, mayor prioridad se asignará a los atributos. La siguiente tabla muestra un ejemplo de ratings de dos productos, seguido por el cálculo del RMRate de la primera tabla.

image

image

La arquitectura del sistema se encuentra basada en tres módulos y se muestra un diagrama a continuación:

image

Los módulos son:

  • Obtención de polaridad – Se encarga de extraer las polaridades de los objetos y de cada atributo y almacenarlas en una base de datos.
  • Modelado de usuario – Toma la base de datos de polaridad y en base al RMRate construye una base de modelos de usuario de m-dimensiones.
  • Recomendación – Basado en el modelo de usuario, se toman los objetos con mayor RMRate.

Los experimentos se hicieron sobre 942 reseñas de 78 usuarios. Los resultados se muestran a continuación:

image

El número de atributos con un RMRate de más de 0.7 por usuario es de 2.68 mientras que al tenerlo por más de 0.8 es de 1.68. Dado esto, se puede deducir que los usuarios ponen prioridades distintas en los atributos. Como primer acercamiento queda como factible la posibilidad de realizar un modelo de usuario en base a este tipo de valores.

Hattori, S., Mao, Z., & Takama, Y. (2012). Proposal of user modeling method and recommender system based on personal values. The 6th International Conference on Soft Computing and Intelligent Systems, and The 13th International Symposium on Advanced Intelligence Systems (pp. 1720–1723). Ieee. doi:10.1109/SCIS-ISIS.2012.6505151

Method of Recommend Microblogging Based on User Model

La herramienta se trata de un sistema que recomienda micro-blogs en base a un perfil de usuario. El primer paso que se realiza consiste en el pre-procesamiento de datos en el que se segmentan las palabras en chino, se marca la naturaleza de las palabras y se eliminan las que menos información aportan (stop words).

Debido a lo corto de los mensajes del medio, se emplea SAM (Spreading Activation Model) para expandir la semántica de las palabras. SAM se divide en una red de activación extendida y una expansión del mecanismo de activación. La primera es similar a una red semántica ya que contiene enlaces y nodos, los nodos son los conceptos y los enlaces su relación semántica. La segunda parte es un proceso que ajusta las entradas, extiende las clases, calcula y da los resultados y extiende todo hasta el final. Un ejemplo de la expansión semántica se muestra a continuación:

image

El SEM (Semantic Expansion Method) indica que si el nodo se encuentra en la distancia extendida y su valor de activación es mayor al del umbral (threshold), entonces el nodo es activado. Se hace un ejemplo partiendo de una estructura original que consiste en Milan, Football y Ball, con un umbral de 0.1 y una distancia de 1. El resultado se muestra a continuación:

image

La representación del modelo de usuario se lleva a cabo mediante vectores y la similitud se calcula con coseno. La propagación de los mensajes hace que se tome en cuenta los comentarios y los forwards de cada mensaje para medir su popularidad. La siguiente figura muestra una ilustración de la propagación:

image

El proceso general es:

  • Pre-procesar los micro-blogs y representarlos en un espacio vectorial.
  • Expandir la semántica mediante SEM.
  • Calcular la similitud entre el usuario y el micro-blog.
  • Obtener el factor de los comentarios y forwards.
  • Si la suma del factor y la similitud es mayor a cierto umbral, recomendar el micro-blog, de lo contrario pasarlo por alto.

Los experimentos se llevan a cabo sobre 19894 micro-blogs obtenidos del API de Sina con distintos temas como finanzas, deportes, entretenimiento, temas militares, turismo, educación, etc. Se hacen pruebas sobre 12 usuarios a quienes se les encuestó sobre las recomendaciones del sistema. Se hicieron 5 pruebas de recomendación que fueron: usando el factor, usando palabras claves, factor con palabras clave, similitud semántica y por último similitud semántica con el factor. La siguiente tabla muestra la satisfacción de los usuarios con las recomendaciones:

image

Al final se concluye que SEM puede ser una solución al problema de poco contexto pero se deben ajustar los parámetros empleados en los temas.

Mei, K., Zhang, B., Zheng, J., Zhang, L., & Wang, M. (2012). Method of Recommend Microblogging Based on User Model. 2012 IEEE 12th International Conference on Computer and Information Technology (pp. 1056–1060). Ieee. doi:10.1109/CIT.2012.216

Trend-Aware User Modeling with Location-Aware Trends on Twitter

Las decisiones de los usuarios se encuentran influidas por el contexto en el que se encuentran. Es por esto que acceden documentos web que contienen cosas, temas o eventos que se relacionan o que ocurren frecuentemente en su localidad. Dado esto, los autores toman la conciencia sobre el lugar (location awareness) como una forma de mejorar los modelos de usuario.

Se modelan las características de las tendencias usando el tiempo en que se dio y el lugar en el que se encontraban los usuarios para suponer que otros usuarios pueden ser influenciados por dicha tendencia si se encuentran en ese lugar y tiempo. Para dar pesos a la localidad y temporalidad se hace uso de TF-IDF y t-TF-IDF.

Se contribuye al problema del inicio en frío puesto que se tendría un panorama general del perfil de los usuarios en cierta locación.

El modelo de usuario se encuentra basado en regiones jerárquicas. El pesado de los conceptos se lleva a cabo por cada región. La siguiente figura es una muestra de este proceso:

image

La figura del árbol generado se parece al mapa de la población global y se muestra en la siguiente figura:

image

Para el procesamiento de los mensajes se empleó el servicio OpenCalais para obtener información semántica sobre los mensajes empleados. Para la parte de geolocalización se usó una combinación del API de twitter con el servicio de Geobatch. En la parte de enlaces de los mensajes, se usó el servicio SemanticProxy (una extensión de la iniciativa Calais).

De los mensajes usados de la base de datos sólo el 66% contienen algún tipo de referencia para la geolocalización. Se tomaron sólo las regiones que contienen 20 usuarios cortando el máximo en 100. Se obtuvieron 53 regiones en total. Para las pruebas se usaron 962 usuarios y la siguiente tabla muestra las opciones empleadas:

image

Algunos de los resultados al probar 160 combinaciones de parámetros muestran que el parámetro más determinante para dar una recomendación es la influencia de la tendencia. El modelo basado en intereses del usuario es 8 veces mejor que cuando sólo se emplean las tendencias. Basarse en entidades es al menos dos veces mejor que hacerlo en temas. La siguiente figura muestra el f-measure de las pruebas:

image

La siguiente prueba consistió en comparar el modelo empleando conciencia sobre el lugar contra un modelo global, dando como resultado lo siguiente:

image

En general los resultados muestran una mejoría al tomar la localidad como contexto a la hora de desarrollar un modelo de usuario. La parte de reconocimiento de entidades es llevada a cabo por un servicio de terceros.

Kanta, M., Šimko, M., & Bieliková, M. (2012). Trend-Aware User Modeling with Location-Aware Trends on Twitter. Semantic and Social Media Adaptation and Personalization (SMAP), 2012 Seventh International Workshop on (pp. 23–28). Luxemburg: IEEE Computer Society’s Conference Publishing Services. doi:10.1109/SMAP.2012.20

Adaptive Updating Algorithm of User Model Based on Interest Cycle

Los intereses de un usuario se mantienen estables por cierto tiempo pero no son completamente invariables. Respecto a la memoria humana, los intereses pueden ser olvidados y luego desaparecer, algunos otros se reactivarán después de estar en un sueño profundo pasando a un estado activo y un nuevo interés puede sustituir a uno viejo.

Las investigaciones sobre psicología muestran que la atenuación y la activación se producen en ciclos de tiempo. Para los intereses de largo término, los ciclos comprenden de uno a varios meses y las fluctuaciones del valor de interés no son muy grandes. Las noticias actuales por otra parte, pueden tener un ciclo muy corto y hasta ser olvidadas por completo con el paso del tiempo.

Se siguen los siguientes pasos:

  • Se tiene un arreglo con los intereses en un tema, el valor del interés y la fecha de creación.
  • Se dividen los intereses del usuario de acuerdo al tamaño de la ventana de tiempo.
  • Se ajustan los puntos de interés cuando no hay valores durante la ventana de tiempo (función de olvido).
  • Se calcula el interés del usuario y los ciclos para los temas.

De acuerdo a su experimento, los intereses de largo plazo tienen un ciclo de 80 o más días. Por otro lado, los intereses de corto plazo quedan con 20 días como máximo en su ciclo. Todo los que se ubiquen entre más de 20 y menos de 80 quedan considerados como intereses a medio término.

La función evolutiva del ciclo de interés se basa en una ecuación de olvido adaptivo. Por otra parte, esto queda complementado con una forma que da incentivos sobre los nuevos intereses que aparecen para el usuario sobre un nodo.

Los experimentos se basaron en comparar el sistema con otros que no tienen contemplados los ciclos de tiempo para cada tipo de memoria (largo, mediano y corto término). Los resultados se muestran a continuación:

image

image

image

En general consideran que quedó cubierto el propósito de simular de manera más fiel el proceso de interés humano al incorporar los ciclos. Se considera que se debe mejorar el método de clasificación y cómo aprovechar los términos que resultaron.

Wang, M., Zhang, B., Zheng, J., Mei, K., & Zhang, L. (2012). Adaptive Updating Algorithm of User Model Based on Interest Cycle. 2012 IEEE 12th International Conference on Computer and Information Technology (pp. 1051–1055). Ieee. doi:10.1109/CIT.2012.215