robots.txt
El archivo robots.txt indica a los rastreadores de los buscadores qué áreas de un sitio pueden o no pueden rastrear. Controla el rastreo, no la indexación.
¿Qué es el robots.txt?
El robots.txt es un archivo de texto plano ubicado en el directorio raíz de un sitio web (por ejemplo, ejemplo.com.mx/robots.txt) que indica a los rastreadores de los buscadores qué áreas del sitio pueden o no pueden rastrear. Usa reglas sencillas como User-agent, Disallow y Allow, y también puede indicar a los rastreadores dónde está el sitemap XML.
Sus usos típicos son mantener a los rastreadores lejos de resultados de búsqueda internos, combinaciones de filtros, carritos de compra o entornos de prueba, para que el presupuesto de rastreo se invierta en las páginas que importan.
Dos limitaciones importantes:
- El robots.txt controla el rastreo, no la indexación. Una URL bloqueada puede aparecer en los resultados de búsqueda si otras páginas la enlazan. Para mantener una página fuera del índice, usa una metaetiqueta
noindex, y no bloquees esa página en el robots.txt; de lo contrario, los buscadores no podrán ver la instrucción noindex. - No es una medida de seguridad. El archivo es público y los bots malintencionados pueden ignorarlo.
En los sitios internacionales, recuerda que el robots.txt se aplica por host: cada dominio de país o subdominio necesita su propio archivo. Revisa también que no estés bloqueando por error a los rastreadores de otros buscadores, como Baiduspider o Yeti de Naver, si esos mercados son importantes para ti.
