Mostrando las entradas con la etiqueta socialnets. Mostrar todas las entradas
Mostrando las entradas con la etiqueta socialnets. Mostrar todas las entradas

viernes, 21 de enero de 2011

So, where is this link actually pointing to?


This link shortening craze is going completely nuts. Can anyone remind me why we needed this at all? Web 2.0 and all that, the model for posts in Twitter is just stupid (and I blame it for all of this).

viernes, 10 de julio de 2009

Observando las elecciones mexicanas desde Facebook y Twitter

Como fue prometido, aquí están algunos de los primeros resultados de los datos recabados por nuestras aplicaciones en Facebook y Twitter durante las pasadas elecciones en México.

Empiezo por aclarar que este post no se debe tomar como un estudio ‘riguroso científico’, sino más bien algunas estadísticas ‘sucias y rápidas’ que pudimos calcular fácilmente a partir de nuestros datos. Estamos ahora en el transcurso de realizar el estudio más detallado y con todos los controles adecuados para obtener conclusiones con un mayor grado de rigor científico.

Otro punto que debe quedar también claro es que, aunque la muestra de nuestro sondeo en Facebook tiene un tamaño razonable (500 participantes), la muestra está muy sesgada. Sólo personas con acceso a internet y con cuenta en Facebook la pueden contestar. Además de que las personas decidieron participar por su propia voluntad, de modo que no tenemos oportunidad de hacer muestreos aleatorios entre el común de la población. Es por esto que nuestro estudio es completamente inútil para contestar preguntas cómo ¿Cuál de los partidos contaba con el mayor apoyo entre la población mexicana? o ¿Qué tan grande era en realidad el movimiento en apoyo al voto nulo?.

Habiendo dicho esto, sin embargo, hay algunas otras preguntas que nuestro estudio si tiene la capacidad de contestar. Dado a que en el sondeo preguntamos no sólo por quién piensan votar, sino también por quién votaron hace 3 años, una pregunta que sí nos podemos plantear es: ¿De donde vienen los votos de cada partido?

  • Si este año votaste por el PAN es porque, lo más probable, ya eras panista.
  • El patrón para el PRD parece similar, es porque ya eras perredista. Pero ojo que no podemos sacar conclusiones muy fuertes porque nuestra muestra en este caso es muy pequeña: sólo 8 personas dijeron que votarían este año por el PRD.
  • El PRI fue quien más ganó en estas elecciones, ya que no sólo anteriores priístas votaron por ellos, sino también una importante cantidad de ex-panistas y un pequeño porcentaje perredistas.
  • Por su parte, quienes decidieron anular su voto eran, en su mayoría, perredistas desilusionados, al igual que un número bastante significativo de panistas.

Otra pregunta muy similar, pero que va en la dirección contraria, es: ¿A donde se fueron sus votos?

  • El PAN pudo conservar un número importante de sus votos de hace 3 años, pero los desilusionados se fueron a inflar los números del PRI y los anulistas este año.
  • El PRD es a quien peor le fue en las elecciones, los anteriores perredistas salieron a buscar opciones en otros partidos o, en su gran mayoría, optaron por anular su voto al no sentirse más representados por las opciones existentes.
  • Y de nuevo el PRI es quien salió mejor librado ya que no sólo atrajo a votantes de otros partidos, sino que prácticamente conservo a todas las personas que anteriormente habían votado por ellos.

Otros datos muy interesantes los podemos obtener de que tanto los usuarios decidieron participar con la aplicación que desarrollamos en Facebook. La aplicación constaba de los siguientes pasos:
  1. Contestar por quién piensas votar este año (92%)
  2. Contestar por quién votaste en el 2006 (66%)
  3. Permitir que tu voto sea revelado, para poder conocer el voto de tus amigos (34%)
  4. Invitar y tratar de adivinar los votos de algunos de tus amigos (17%)
Como se puede ver, los porcentajes caen rápidamente por cada click adicional que le pedimos dar a los usuarios. Pero lo verdaderamente interesante aparece cuando tratamos de medir el nivel de participación de los usuarios según su opinión política. Para esto, cada que 10% de los votantes de un partido completen una de las 4 etapas mencionadas arriba se les va a sumar 1 punto de participación. Para un partido hipotético, donde el 100% de sus votantes realizaran las 4 tareas obtendrían en total 40 puntos de participación. El mínimo son 10 puntos porque, al menos, el 100% de los votantes de un partido cumplieron con el paso 1. Estos son los resultados:
  • El PAN obtiene 27 puntos, e invitaron a una media de 5 personas a participar.
  • El PRI obtienen 24 puntos, e invitaron a una media de 6.5 personas a participar.
  • Los anulistas obtienen 22 puntos, e invitaron a una media de 3 personas a participar.
Totalmente en contra a lo que nosotros habríamos esperado, estos resultados sugieren que quienes anularon este año su voto fueron quienes menos estaban dispuestos a participar y discutir sus opiniones políticas con sus amigos.

Recordemos que el PRD no aparece en esta lista porque de ellos no tenemos datos suficientes. De hecho el PRD es también el único partido u opinión política que no contaba con un grupo numeroso (más de 100 miembros) de simpatizantes en Facebook. Esto es en contraste con los grupos del PAN (7 mil miembros), el PRI (5 mil miembros) y los diversos grupos anulistas, como este grupo con cerca de mil miembros. Esto por un lado muestra el sesgo en cuanto a opiniones políticas dentro de Facebook, pero también sugiere que, por otro lado, los simpatizantes del PRD no se sienten actualmente con mucha confianza de mostrar o discutir sus opiniones políticas en público.

Pasando ahora a la discusión sobre las elecciones en Twitter, tenemos algunos datos interesantes recolectados por nuestra cuenta @votosmexico.


Esta primera gráfica muestra, cada día desde dos semanas antes de las elecciones, el volumen de personas que estaban hablando o discutiendo sobre las elecciones mexicanas en Twitter. Esta información está aproximada contando al número de personas que usaban algunas de las hashtags principales en las elecciones, así como personas localizadas cerca de México utilizando palabras claves como ‘voto’, ‘votar’, o ‘anular’. Parte del reto aquí fue tratar de eliminar en lo posible el ruido inducido por las también recientes elecciones en Irán y Honduras (sin eliminar mensajes de cualquier modo reelevantes), así como de otras ‘votaciones’ como las de Tweeter Wall.

Entre los datos interesantes aquí se puede ver como los anulistas usando la hashtag #votonulo se mantuvieron bastante constantes discutiendo y promoviendo sus opiniones políticas todo el tiempo, pero fueron al final superados por gente discutiendo las elecciones en general, como son aquellos usando la hashtag #votomx. Además del obvio interés marcado en los días antes y el pico el mismo día de las elecciones, es interesante ver los twitteros descansan los fines de semana.


En nuestra última gráfica podemos ver el nivel de influencia ejercido por diferentes cuentas en Twitter durante las elecciones. Cada linea muestra la cantidad acumulada de personas que, hasta ese día, habían hecho alguna mención (ya sea por un RT o discutiendo alguna opinión) a alguna de estas cuentas principales y en el contexto de las elecciones mexicanas.

La cuenta de @el_universal_mx se mantuvo siempre en el radar y el mismo día de las elecciones se convirtió en la fuente principal de noticias sobre las elecciones en Twitter. Por su parte @emarchita, una de los principales cuentas promotoras de la campaña del voto nulo, y nuestra misma cuenta de @votosmexico, se convirtieron en la 2a y 3a cuentas con más influencia. El curioso caso es @eamexico, aparentemente una cuenta relacionada con Electronic Arts en México, quien saltó a la popularidad en el último minuto después de anunciar la promoción de una rifa de 5 juegos de video entre quienes enviaran una foto con su pulgar después de haber votado. Finalmente en la 4a y 5a posición terminaron @acidminds y @eoz quienes fueron dos de las principales cuentas que se mantuvieron constantes durante toda la temporada electoral discutiendo sus opiniones y compartiendo información relevante. En particular una felicitación muy grande a ellos pues fueron dos piezas clave en la discusión y promoción de ideas políticas en Twitter durante las pasadas elecciones.

Ya para terminar con este laargo post, corrimos un algoritmo para encontrar y agrupar twits similares entre todos los que recolectamos. Así es como pudimos encontrar cuales fueron los mensajes más compartidos en Twitter durante las pasadas elecciones.

Los primeros son dos de @tattoohunter y uno de @paw, en total recibiendo 37 retweets, que contrastaban a la campaña del voto nulo contra la situación ocurriendo en Irán y Honduras.
tatoohunter: Salir a la calle cuando hay toque de queda y soldados disparando ES DEFENDER LA DEMOCRACIA. Anular el voto es HACERSE PENDEJO.

Los siguientes son de @ba_anderson y @noticieroscom, en total 24 retweets, que anunciaban las promociones en Oxxo y Vips.
ba_anderson: al café de Oxxo se suma ahora un postre gratis en Vips por votar el 5 de julio: http://bit.ly/NI0U5

Finalmente, les dejamos aquí los siguientes 3 mensajes más compartidos que recibieron 10, 10 y 9 retweets respectivamente.
el_universal_mx: Se dispara 400% #VotoNulo en el DF. Alcanza hasta 12%. http://ito.com.mx/bO47 #votomx
ragazza007: Vamos a votar este domingo!! votemos por las putas, porque votar por sus hijos no sirve de nada...
ecastillo: Si existe el PSD que legaliza las drogas porque no el PNG que aumente la Banda Ancha! #VotoMX http://pix.im/SU2Uj

martes, 19 de mayo de 2009

Social Juan

Estoy en San Jose, California, justo después de terminar la conferencia ICWSM sobre blogs y medios sociales. La primera noticia, y que ya muchos se enteraron en mis feeds de Facebook y Twitter, es que nuestro trabajo sobre el contenido compartido por bloggers en la red ganó el premio al mejor paper del workshop sobre datos!

A parte de, por supuesto, estar muy contento por el reconocimiento, tuve al fin la oportunidad de llevar a cabo uno de mis principales retos personales: Presentar la foto de un lolcat en un foro serio de investigación.


La investigación puede ser divertida. :-D

Ya hablando más en serio, la experiencia de asistir a este congreso fue sensacional. Aprendí muchas cosas nuevas e interesantes, de las cuales les voy a platicar en el resto del post. Es increíble la oportunidad que hoy en día el internet y las redes sociales nos dan para entender más de nosotros mismos, de la forma de relacionarnos con otras personas, y en general de nuestra forma de percibir al mundo.

Uno de los experimentos que más me gusto, realizado por Duncan Watts de la Universidad de Columbia, estaba diseñado para determinar que tanto la popularidad de una idea u objeto, digamos por ejemplo una canción, está determinada por propiedades particulares de la canción misma, o por un efecto social externo donde las canciones se vuelven populares simplemente porque hay mucha gente hablando de ellas, ocasionando que se vuelvan aún más populares, y que aún más gente hable de ellas, y así en una avalancha de creciente popularidad consecuencia de una cascada social.

Para probar esta teoría, Watts y su equipo de trabajo diseñaron una página Music Lab donde invitaban a jóvenes a descubrir música de nuevos artistas (todos ellos desconocidos) y bajar la música que les gustara.

Y aquí está la genialidad del experimento: Los usuarios que entraban a la página eran asignados, sin que ellos lo supieran y de manera aleatoria, a uno de 9 ‘mundos’. En uno de los mundos, los usuarios podían ver las canciones, escucharlas y bajar las que les gustaran. En los 8 mundos restantes a los usuarios se les mostraba además, junto a los datos de la canción, cuantas otras personas (dentro su mismo ‘mundo’) habían bajado ya la canción.

Los resultados fueron simplemente sorprendentes. Dentro del mundo donde los usuarios no podían ver cuantas personas habían bajado ya las canciones, la populariad de entre todas las canciones se distribuía más o menos de forma lineal, desde las menos a las más populares. En todos los 8 mundos restantes, sin embargo, la popularidad crecía de manera exponencial siguiendo esta regla de que “las populares se vuelven más populares”.

Más interesante aún, los ‘hits’ en diferentes mundos eran diferentes. Aún conociendo con exactitud toda la información sobre la popularidad de canciones en uno de los mundos, es muy difícil predecir cuales serán las canciones populares en otro de los mundos. Watts define, de hecho, una métrica de ‘impredecibilidad’ y demuestra que la influencia social incrementa esta métrica.

Otro tema recurrente, que aparecía una y otra ves en diferentes estudios, es el principio de ‘homophily’ que en simples palabras dice: “A las personas les gusta llevarse con personas que son y que piensan como ellas mismas”. Personas con gustos e intereses similares van a tender a reconocerse y seleccionarse como amigos.1 En Facebook, por ejemplo, encontraron que el mejor predictor para ver si una persona va a subir fotos es si sus amigos han subido fotos.2

Varios de los estudios fueron realizados utilizando crowdsourcing donde se utiliza a grupos de humanos para resolver tareas que son fáciles de resolver para ellos pero difíciles para las computadoras. Esta idea la utiliza Google para etiquetar imágenes, y también fue así como Facebook tradujo su interfaz a diferentes idiomas. Para los que no quieren trabajar de gratis, Amazon tiene un sitio, Mechanical Turk, donde le pagan a humanos para realizar este tipo de tareas: “Inteligencia Artificial Artificial”.

Como puntada curiosa, uno de los investigadores se quejó de que uno de sus estudios en Mechanical Turk fue atacado por ‘bots’ haciéndose pasar por humanos resolviendo las tareas.3

Otro de los hechos que me llamaron mucho la atención fue que una buena parte de la discusión y registro de notas sobre puntos interesantes de la conferencia fue llevada a cabo, precisamente, en medios sociales. Mia, por ejemplo, publicó en su blog una serie de notas sobre la conferencia. Y más interesante aún fue el seguimiento e intercambio de opiniones ‘en tiempo real’ usando la hashtag #icwsm en Twitter.

Ya para terminar, les comento la última curiosidad y es sobre las hashtags que se usan en Twitter para agrupar información o comentarios respecto a un tema específico. Lo realmente curioso del caso es que las hashtags no fueron inventadas por Twitter, sino por los usuarios de Twitter. Casi como una ‘conciencia global’ se pusieron todos de acuerdo en adoptar esta convención que, aprovechando la función normal de búsqueda en Twitter, sirve precisamente para etiquetar comentarios que tienen un tema en común.

1. Dominique Cardon, et al. Does showing off help to make friends? Experimenting a sociological game on self-exhibition and social networks.
2. Cameron Marlow, Facebook. (Panel discussion)
3. Andrew Gordon, Identifying Personal Stories in Millions of Weblog Entries.

lunes, 20 de abril de 2009

Dime que blogueas, ...

Al fin está aquí el prometido, desde hace mucho, post sobre mi trabajo en redes sociales. Como un poco de contexto, aquí en el MPI-SWS donde hago mi postdoc, hay un grupo más o menos fuerte en esa área. He asistido a varias de sus pláticas y poco a poco me he ido interesando mucho en el trabajo que hacen. Este trabajo en particular surgió en las vísperas de año nuevo cuando, sin tener mucho que hacer, Mia me comentó sobre un challengue propuesto en el workshop de una conferencia sobre blogs y medios sociales.

Resulta que una spinn3r, una empresa que se dedica a recorrer e indexar el contenido de feeds publicadas en la red, puso a disposición de la comunidad científica una colección significativa de la información que han recabado. El reto lanzado a los científicos era simplemente observar los datos y tratar de encontrar algo interesante en ellos: análisis de las ligas, extraer redes sociales, rastrear la evolución de noticias, etc. En la página del workshop pueden encontrar la lista de trabajos aceptados.

En este post lo que quiero platicar es un poco de las cosas que pudimos encontrar al analizar estos datos. Es un estudio bastante exploratorio, o sea del tipo “pues a ver que encontramos”. Voy a platicar también todo super informal, tratando de presentar curiosidades que encontramos y me parecieron interesantes o divertidas, más que resultados ‘científicos’ formales. Los que estén interesados en el trabajo un poco más formal pueden obtener de mi página una copia del artículo que vamos a presentar el mes próximo en San José, California.

Los resultados están basados en casi 8 millones de posts, publicados en poco más de 1 millón de blogs que pudimos encontrar entre los datos proporcionados por spinn3r. Aunque estos pueden parecer muchos posts y blogs, en realidad representan una pequeña fracción del número de blogs que existen en todo el Internet. Nos concentramos en blogs de 15 diferentes dominios entre los que están MySpace, Spaces (de Windows Live), Wordpress y Blogger. Empezando con algunas notas interesantes
  • MySpace es de los que tenían más usuarios, pero también de los que menos postean.
  • Los más posteadores son de LiveJournal y, de los dominios principales, le sigue Blogger.
  • La mayoría de la población en Spaces son chinos.
  • Los japoneses tienen su dominio preferido, exblog.jp, mantenido por Excite.
  • Quienes hablan persa (Irán, Afganistán, y Tayikistán) se juntan en blogfa.com.

Luego analizamos como es que los blogs se ligan unos a otros así como, por ejemplo, arriba en este post yo puse una liga al blog de Mia. Algunos recordarán que en algún momento al inicio del año yo me quejaba de lo horrible que era MySpace y es que, la mayoría de los blogs, ponen el nombre del usuario en la dirección de la liga, por ejemplo, miren que bonito:
   navarroj.blogspot.com/2009/...
Mientras que las ligas de MySpace se ven así:
   www.myspace.com/lindsaylohan
o así:
   blogs.myspace.com/index.cfm?fu...friendId=29730276&...
o cualquiera de otras n mil variedades que se les ocurrieron a los developers de MySpace. Así que ahí nos tienen prácticamente un día entero tratando de parsear todos los formatos posibles, y mapeando los numeritos con los respectivos nombres de usuario. ¡Horrible!

Bueno, ya que desahogué mi frustración contra MySpace, algunas de las cosas que encontramos:
  • Casi no hay reciprocidad entre blogs, la mayoría de las ligas son de blogs ordinarios apuntando a blogs ‘famosos’. Esto es en contraste con otras redes, como Flickr, donde sí hay mucha reciprocidad.
  • La red en general es esparsa, no está tan interconectada como, digamos, Facebook.
  • A los blogeros no les importa el dominio. Posts en Blogger, por ejemplo, ponen ligas a Wordpress o LiveJournal igual que lo hacen a Blogger mismo.
  • El lenguaje, sin embargo, si impone barreras. La gran mayoría de las ligas son entre blogs que hablan el mismo idioma.
  • Entre las pocas ligas con blogs de diferentes idiomas, sin mucha sorpresa, la gran mayoría son de blogs en otros idiomas que apuntan a blogs en Inglés.
  • El blog que recibió más ligas: I Can Has Cheezburger?, Lolcats FTW!

Luego nos interesamos también en revisar qué tipo de contenido suelen compartir los blogeros. Como es interesante, voy a poner la lista completa del top 10
  1. youtube.com
  2. photobucket.com
  3. flickr.com
  4. imageshack.us
  5. amazon.com
  6. nytimes.com
  7. twitter.com
  8. technocrati.com
  9. tinypic.com
  10. bbc.co.uk

Interesante ver a un par de sitios de noticias, New York Times y la BBC, pero viendo que prácticamente la mitad de las ligas son a sitios de imágenes y un tercio son ligas a YouTube, estaba ya pensando que todo lo que hay en los blogs son fotos y videos de gatos.

Otro dato interesante, es que diferentes dominios tienen diferentes sitios ‘preferidos’. Por ejemplo Wordpress y Blogger tienden a ligar imágenes en Flickr, mientras que Spaces prefiere imageshack.us y LiveJournal photobucket.com. Para rescatar un poco la fe en la humanidad, Wordpress, LiveJournal y Blogger tienen todos un número significativo de ligas a Wikipedia.

Ya para terminar, en nuestro pequeño estudio nos pusimos a ver en más detalle el tipo de contenido más popular en la blogósfera: videos en YouTube.

Para mi sorpresa, la categoría de videos más compartida en la red es: Noticias y Política. Le siguen, mucho menos sorpresa, videos que han sido dados de baja por violaciones de términos o copyright, y luego videos musicales. Cabe también aclarar que la muestra de blogs que nos dieron fue tomada en los meses cerca de las pasadas elecciones en los Estados Unidos, lo que puede explicar la gran cantidad de videos en política. Los dos canales más populares en la muestra son, precisamente, los canales oficiales de Obama y McCain.

Una de las observaciones más interesantes que encontramos es que los videos de política son explosivos. Del momento en que se suben a YouTube, no pasan más de unas cuantas horas, cuando el video está ya dando la vuelta y propagándose por todos los blogs. Y así de rápido como vienen, se van. Después de unos días, ya nadie habla de ellos. Por el contrario, los videos de música tardan meses en propagarse por la red, y la gente sigue hablando de ellos aún años después de que se ha subido el video.

Ya para terminar, y como bonus para los que llegaron a leer hasta aquí, algo del material que no fue publicado en el paper: el resto del top 10 con los canales en YouTube que tienen la mayor cantidad de ligas entre blogs
  1. TPMtv (Noticias)
  2. CBS (Noticias)
  3. The Margins of Error (Comedia Política)
  4. Brave New Films (Opinión/Noticias)
  5. Universal Music Group (Música)
  6. alpinekat's Channel (Ciencia) <- Large Hadron Rap!
  7. C-SPAN (Política)
  8. Digital Ethnography (Educación) <- Muy bueno, chéquenlo!

Así que bueno, eso es todo por hoy, y espero que lo hayan encontrado interesante!

jueves, 2 de abril de 2009

Redes Sociales

El martes pasado tuve la oportunidad de asistir a un workshop sobre investigación en redes sociales. Si, redes sociales, como Facebook, YouTube y Flickr. Y si, investigación, como la que se hace en universidades, centros e institutos de, uhm, investigación. Hasta hace poco más de un año no me había siquiera pasado por la mente que se pudiera hacer investigación en esta área. Después de pensarlo un poco, y de ir conociendo un poco más sobre el tema, me parece increíble la gran cantidad de problemas de investigación que se encuentran aquí: seguridad, privacidad, sistemas, redes, almacenamiento y distribución de datos, diseminación y popularidad de contenido, interfaces humano-computadora, minería de datos, sociología, psicología, y un gran pero gran etc.

En el MPI-SWS, donde trabajo, hay de hecho un grupo fuerte de investigadores trabajando en esta área. Y de estar atendiendo yo a sus pláticas y presentaciones, aunado al hecho de que la mitad de mi vida la pierdo de por si en redes sociales, fue que me fui interesando cada vez más en la investigación que hacen. Ya tuve incluso mi primer ‘pinino’ en el área: un trabajo sencillo pero interesante—que vamos a presentar en Mayo—en el contexto de blogs y sobre cómo videos de YouTube se esparcen por la “red de blogs”. Pero bueno, el recuento detallado del artículo y de los resultados que encontramos los prometo para otro post en unos días más. (Ya lo quiero escribir, pero mi co-autora sigue haciendo cambios y correcciones “de estilo” al artículo, y me quiero esperar a tener la versión definitiva.)

Este post es, por lo pronto, sobre algunas de mis experiencias en el workshop y, en particular, uno que me pareció el mejor de los trabajos presentados. El trabajo lleva el título de “Eight friends are enough” (Ocho amigos son suficientes) de Joseph Bonneau, Jonathan Anderson, Ross Anderson, y Frank Stajano de la Universidad de Cambridge [1]. Veamos de que se trata. Quizá algunos de ustedes han notado que, si buscas el nombre de alguna persona en Google, es probable que te encuentres con alguna información sobre su perfil en Facebook.


Esto es posible ya que Facebook, por default, publica una versión ‘pública’ de tu perfil. El perfil incluye datos básicos sobre ti: tu nombre, la foto de tu perfil, la región a que perteneces, algunas de tus páginas favoritas, y una selección al azar de 8 de tus amigos. La idea de estos perfiles públicos es que tus amigos o familiares te puedan encontrar buscando tu nombre en Google, y la lista de 8 amigos es para ayudar a darles una idea sobre si la persona que encontraron eres tú, o quizá es alguien más que tiene un nombre parecido.

El que si los perfiles públicos son o no una buena idea, es definitivamente un punto interesante, pero que no discutiré en este post. Lo único que voy a comentar es que: (1) yo si tengo perfil público y (2) si no te gusta la idea, puedes eliminar este perfil en las opciones de Facebook.

Regresando a lo interesante en este momento, que es sobre el artículo presentado en el workshop, es que los investigadores de Cambridge se preguntaron: “¿Será posible obtener, a partir de los 8 amigos que se muestran en el perfil público, alguna información sobre la estructura real de la red de amigos en Facebook?”

En primera instancia parece que no puedas extraer mucha información sobre mi si te digo quienes son 8 de mis 227 amigos en Facebook. Sin embargo, hay un punto interesante a notar: es probable que en algunos de los perfiles públicos de mis 227 amigos, aparezca yo listado como uno de sus amigos. Esto no te va a servir para obtener la lista completa de mis amigos (ni en general tampoco para obtener la red completa de amigos en Facebook) pero si parece estar dando algo más de información de la que aparentaba en un principio.

Por supuesto, el problema es aún más interesante cuando se plantea de forma general y en términos un poco más matemáticos: “¿Qué tanta información se puede extraer sobre un grafo (una colección de nodos y aristas) cuando sólo tienes acceso a k vecinos (determinados al azar) de cada nodo?”

Los autores encontraron que (usando diversos trucos y algoritmos de grafos) es posible aproximar con buena exactitud, propiedades interesantes del grafo como: número de vecinos (amigos), centralidad de los nodos, conjuntos dominantes (conjunto pequeño de nodos cuyos vecinos cubren toda la red), rutas cortas entre nodos, y comunidades en la red.

Sobre el porqué estas preguntas “matemáticas” son interesantes en el “mundo real” considera lo siguiente: Alguien malicioso podría tratar de comprometer las cuentas (robar sus passwords) de los usuarios en un conjunto dominante de la red, y usarlas para difundir spam entre la mayor cantidad de usuarios en Facebook y con el menor esfuerzo posible. Nodos centrales, por otra parte, pueden ser utilizados para interceptar, con alta probabilidad, la mayoría de los mensajes que recorren la red.

Muy interesante fue que los investigadores asistentes al workshop inmediatamente comenzaron a proponer, discutir y debatir diferentes ideas sobre cómo modificar los perfiles públicos de Facebook para poder seguir mostrando 8 amigos pero sin exponer, al mismo tiempo, tanta información sobre la red de amigos. ¿Elegir amigos al azar, pero con preferencia a ‘ciertos’ tipos de amigos? ¿Incluir algunos amigos ‘falsos’? ¿Incluir una mezcla de amigos directos, y amigos de amigos? ¿Limitar el número de perfiles en los que una persona aparece como “amigo de”? Algunas de estas ideas parecen funcionar, en el sentido de que los métodos de Bonneau, et al ya no serían aplicables, o darían resultados imprecisos, pero pueden traer otros problemas prácticos (¡yo no quiero amigos falsos en mi perfil!) o técnicos (difíciles o costosos de implementar). De cualquier modo, esto dará definitivamente para algo más de investigación muy interesante al respecto. I love research.

Como otra nota curiosa, y ya para ir terminando este post, les comento que me tocó compartir habitación con uno de los empleados de Facebook que trabaja en el equipo de seguridad (previniendo y reaccionando cuando hay ataques de spam o cuentas robadas). Respecto a los cambios recientes en el “Nuevo Facebook” comentó que tuvieron, de hecho, una activa discusión dentro de la empresa sobre los cambios que implementar. No tanto sobre el diseño o “las esquinas redondas” en las fotos, que tristemente parece ser lo único que los “quejosos del Nuevo Facebook” parecen notar, sino sobre la funcionalidad de un componente importante: la News Feed.

Una fracción de los empleados proponían mantener y mejorar una feed “inteligente” que te muestra más noticias sobre los amigos con los que más interactúas, y con controles para “ajustar” los tipos de noticias que prefieres recibir y de cuales de tus amigos (e.g. un poco más de este amigo, un poco menos de este otro). La otra fracción, argumentando que los usuarios de Facebook son “tontos” y no entienden (ni les interesan) estas listas inteligentes, proponían una feed “tonta” que simplemente mostrara, en tiempo real, todas las noticias, de todos tus amigos, con filtros “simples” por grupos de amigos o por tipos de noticias. ¿Adivinen quienes ganaron la discusión? Si, la feed que tenemos ahora muestra las noticias en tiempo real.