Mostrando las entradas con la etiqueta Sitemaps. Mostrar todas las entradas
Mostrando las entradas con la etiqueta Sitemaps. Mostrar todas las entradas

viernes, 1 de febrero de 2008

Las imperfecciones de Google

Después de haberle hecho una crítica a Technorati, ahora vienen unos palos para Google. Ojo, estoy más que agradecido por la cantidad de herramientas gratuitas que ofrecen, desde el mismo Blogger, las Webmaster Tools, Analytics, etc, etc, pero igual hay cosas que funcionan MAL. Voy a mencionar las tres principales:

1) No entiendo porque la búsqueda con el operador link me sigue sin dar resultados, cuando ya tengo varios links entrantes confirmados, además de decenas de comentarios y trackbacks que hice en blogs de Technorati y bitacoras.com. Para los que no se acuerdan de que se trata, leer "El Operador de búsqueda link".

2) Me saca de onda que Google no indexe bien todas las páginas. Para verificar eso, hay que utilizar el operador "site:". Cuando analizo los resultados del search para "site:daniserra.blogspot.com", me doy cuenta que siempre hay páginas que faltan. Al principio pensé que eso me pasaba porque no les había mandado el Sitemap, entonces lo mandé. Como el problema persistía, le pregunté a los expertos, y muy amablemente, webseo me contestó que necesitaba un sitemap.xml, y yo me dije...un what?
Entonces me averigüé TODO acerca del sitemap.xml, y encontré un sitio buenísimo para generarlo llamado xml-sitemaps.com. La herramienta te genera un archivo .xml que hay que ponerlo en el root folder del blog, o sea en daniserra.blogspot.com/sitemap.xml, cosa que NO SE PUEDE HACER con Blogger, que es de Google. Y esta es la tercera critica, blogger es muy limitado. Otro ejemplo: los trackbacks que funcionan cuando quieren. De haber empezado hoy de cero, este blog estaría en Typepad.

Por suerte, en todo este tiempo invertido de problem-solving se aprende muchisimo, pero sería mejor que Google funcione bien y uno le dedique el tiempo a explorar otras cosas.

Blogocosa.com

sábado, 19 de enero de 2008

Hay que entrar a las Webmaster tools más seguido.

Hoy aparecieron bastantes mensajes cuando entré a las webmaster tools de Google. La herramienta es buenísima porque te marca los problemas que tuvo el bot cuando pasó por tu página.

1) Me marca como error a 8 páginas restringidas por robots.txt. Cuando cargué el robots.txt me llamó la atención la instrucción "Disallow: /search" (mi archivo robots.txt está acá). No la entendí pero la dejé. Resulta que las 8 páginas restringidas son páginas de Labels, por ejemplo http://daniserra.blogspot.com/search/label/Dani%20Serra que te muestra todas las páginas que tienen "Dani Serra" como label. Investigando un poco descubrí que eso se hace para que Google no indexe páginas redundantes, o sea, información duplicada, ayudando al bot a focalizarse en las páginas importantes. Ahora que llené de labels los posts viejos, me van a aparecer muchas páginas restringidas por robots.txt, pero mientras sean páginas de labels search, no hay problema.

2) En el sitemap, dos mensajes en chino básico: "XML no válido: demasiados códigos" para la etiqueta principal channel (...) y "Espacio de nombre incorrecto en la línea 2" (será un bondi?). Después de 15' minutos de leer el help no entiendo nada, con lo cual espero que no sea grave.

3) Me dice que hay 26 urls en mi blog, y dado que tengo 36 posts, hay 10 que no los está indexando, y por lo tanto son invisibles para Google. Google me aclara que es normal que haya páginas no indexadas, yo prefiero corregir esa "normalidad".
Hago una búsqueda de "site:daniserra.blogspot.com" (un Operador Google de búsqueda, muy útil) para ver cuales están y cuales no. Muy interesante dado que:
- hay posts que todavía aparecen con el nombre viejo del blog (o sea, el bot no las volvió a visitar desde aquella vez).
- hay posts viejos que borré pero todavía quedaron en el caché de Google.
- hay posts que no están.
A los primeros y a los terceros les vuelvo a hacer ping (me hace acordar a Technorati...). La verdad, no se me ocurre otra manera de solucionarlo. Vamos a ver mañana si cambió algo.

4) Encuentro una sección para solicitar la eliminación de una página, con lo cual elimino esos posts que escribí al principio, luego borré, pero que todavía están en el caché de Google.

Como dice el título, hay que visitar las Webmaster tools más seguido, uno se lleva sorpresas.

Add to Technorati Favorites

miércoles, 9 de enero de 2008

Un robot obediente: la página /robots.txt

En uno de los primeros posts mencioné al robots.txt y lo dejé como tema pendiente. Bueno, acá vamos con ese tema.

Cuando cualquier bot entra al site, lo primero que se fija es si el webmaster le dejó indicaciones en la página /robots.txt. Una de esas indicaciones podría ser, por ejemplo, que no entre a determinada parte del site, o a ninguna. Otra indicación es decirle donde se encuentra el Sitemap así conoce la estructura del site y no se pierde nada.

En mi caso, el código de mi robots.txt puede verse en http://daniserra.blogspot.com/robots.txt con lo cual, las indicaciones que yo le doy son:
1) "A este site lo podés recorrer todo, tanto vos Googlebot como cualquier otro bot". El asterisco en "User-agent: *" dice que están todos los bots bienvenidos, y el "Disallow: /search" dice que no los estoy excluyendo de ningúna parte.
2) "Mi site map está acá: Sitemap: http://daniserra.blogspot.com/feeds/posts/default?orderby=updated, no te pierdas ninguna página please.

Muy simple pero muy importante para darle la bienvenida e indicaciones precisas a nuestro visitante.

Próximo post: MyBlogLog

martes, 8 de enero de 2008

Sitemaps basics

Las Webmaster Tools de Google me rompieron la cabeza. Es una página donde aparecen estadísticas, herramientas de diagnóstico de mi site, maneras de optimizar el indexing en Google, increíble. Acá deben pasarse mucho tiempo los pros que viven de optimizar sus páginas en Google.

En el tab de Overview, me confirman que mi página (ya verificada) está en el index de Google, pero que todavía no mandé el Sitemap. Parece importante así que seguimos por ahí.

Un Sitemap es una lista de las páginas del site, que ayuda al Googlebot a entender la estructura y a no pasarse por alto ninguna sección. Son especialmente importantes cuando uno tiene contenido dinámico (y nada más dinámico que un blog), y también cuando el sitio es nuevo y tiene pocos links externos que le apuntan. También se le puede indicar que páginas son más importantes que otras, y con que periodicidad se actualiza cada una.

Voy entonces al Tab que dice Sitemaps > Add Sitemap > Choose type > Add General Web Sitemap, y cargo daniserra.blogspot.com/rss.xml que es la manera más fácil (y suficiente para un blog como este) de subir el sitemap como feed. También podría haber subido una lista de las urls del site en formato .txt (o sea, una lista de las Permalinks) o utilizar el Sitemap Generator que es demasiado pro para mis objetivos.

Ahora hay que esperar alguna horas hasta que se actualiza la info. Vamos a ver como mejora la performance con este agregado.

Próximo tema: el operador de búsqueda "link".