¿Cómo permitir que la IA lea tu web? robots.txt y llms.txt

Para permitir que la IA lea tu web, revisas tu archivo robots.txt y te aseguras de no estar bloqueando a los rastreadores de inteligencia artificial como GPTBot, ClaudeBot, PerplexityBot y Google-Extended; el llms.txt es una propuesta más nueva y opcional que, hoy, los grandes buscadores dicen no usar. En otras palabras: la puerta principal es el robots.txt, y de ti depende dejarla abierta.
Muchos dueños de negocio no saben que su web ya está diciéndole a la inteligencia artificial si puede entrar o no. Esa instrucción vive en un archivo diminuto llamado robots.txt, y a veces está bloqueando a la IA sin que nadie lo haya decidido a conciencia. Vale la pena entenderlo, porque de ahí depende que ChatGPT, Perplexity o Gemini puedan leerte y citarte.
¿Qué es el robots.txt y para qué sirve?
Es un archivo de texto que vive en la raíz de tu sitio (en tudominio.com/robots.txt) y le dice a los rastreadores automáticos —los «bots» que recorren la web— a qué pueden entrar y a qué no. Existe desde hace décadas y es el mecanismo estándar para dar o quitar permiso de rastreo.
Cada bot se identifica con un nombre, y en el robots.txt puedes permitir o bloquear a cada uno. Los rastreadores de IA más relevantes hoy son:
- GPTBot, de OpenAI (la empresa de ChatGPT).
- ClaudeBot, de Anthropic (la empresa de Claude).
- PerplexityBot, del buscador con IA Perplexity.
- Google-Extended, la señal con la que controlas si Google usa tu contenido para sus productos de IA (distinta del rastreo normal de búsqueda).
Si tu robots.txt bloquea a alguno de ellos, esa IA no podrá leer tu contenido y, por lo tanto, difícilmente podrá citarte o recomendarte.
¿Me conviene dejar entrar a la IA o bloquearla?
Depende de tu objetivo, y ese es precisamente el dilema. Bloquear a los rastreadores de IA protege tu contenido de ser usado sin control, pero al mismo tiempo te vuelve invisible para esas plataformas. Es una decisión de negocio, no solo técnica:
- Si quieres ser citado y recomendado por la IA, déjala entrar. Para la mayoría de las pymes que buscan más visibilidad y clientes, cerrarle la puerta a GPTBot o PerplexityBot es cerrarse a un canal creciente donde la gente ya hace preguntas y toma decisiones.
- Si tu preocupación es proteger contenido propietario —cursos, investigaciones, material exclusivo— puede tener sentido bloquear ciertos rastreadores en esas secciones. Pero considera que también renuncias a aparecer en las respuestas de esas IA.
Para la mayoría de los negocios que quieren crecer, la recomendación equilibrada es dejar entrar a los rastreadores de IA y concentrarse en que el contenido esté bien hecho, y reservar los bloqueos solo para secciones realmente sensibles.
Un matiz importante: no todos los bots de IA hacen lo mismo. Algunos recorren tu web para entrenar modelos, otros para responder preguntas en tiempo real citando fuentes (como Perplexity), y otros para ambas cosas. Si tu objetivo es aparecer y ser citado cuando alguien pregunta, te interesa sobre todo dejar pasar a los que buscan responder con fuentes. Distinguir entre unos y otros es un tema técnico, pero la idea de fondo es simple: bloquear a ciegas puede sacarte justo de los lugares donde querrías aparecer.
¿Y el llms.txt? ¿Necesito uno?
El llms.txt es una propuesta más nueva y opcional para guiar a los modelos de IA, pero hoy no deberías esperar resultados de él. La idea es interesante: un archivo donde le indicas a las IA cuál es tu contenido más importante y cómo entender tu sitio, una especie de «mapa» pensado para modelos de lenguaje.
El problema es que es un estándar emergente y disputado. Google, por voz de John Mueller y Gary Illyes (julio de 2025), señaló que los grandes bots no lo usan hoy. Es decir: nadie te garantiza que ponerlo sirva de algo por ahora. Eso no lo vuelve inútil —puede consolidarse en el futuro—, pero sí te ayuda a calibrar expectativas.
Nuestra postura honesta para una pyme:
- No es obligatorio. No pasa nada si no tienes un
llms.txt. Tu prioridad debe ser elrobots.txty la calidad de tu contenido. - Impleméntalo si quieres, como apuesta a futuro. Es de bajo costo y no hace daño. Si tu desarrollador lo agrega, adelante; pero no lo pongas esperando un salto de visibilidad inmediato.
- No lo confundas con permiso de acceso. El
llms.txtorienta; elrobots.txtes el que realmente permite o bloquea el rastreo. Ese es el que sí debes revisar.
El
robots.txtes la puerta; elllms.txtes, por ahora, apenas un letrero que muchos aún no leen.
¿Qué debería hacer en concreto?
Empieza por lo que sí tiene efecto comprobado: revisa tu robots.txt. Estos son los pasos sensatos para una pyme que quiere ser citada:
- Abre
tudominio.com/robots.txten tu navegador y revisa si aparece alguna línea que bloquee a GPTBot, ClaudeBot, PerplexityBot o Google-Extended. Si no sabes interpretarlo, pídele a tu desarrollador que lo revise. - Si estás bloqueando sin querer a la IA y quieres ser citado, quita esos bloqueos. A veces vienen puestos por defecto en ciertas plantillas o plugins.
- Reserva los bloqueos para lo que de verdad debe estar protegido, no para todo el sitio.
- Deja el
llms.txtcomo opcional, sabiendo que hoy su impacto es incierto.
En resumen
Controlar qué IA lee tu web es más sencillo de lo que parece: casi todo se decide en el robots.txt, ese archivo pequeño que da o quita permiso a los rastreadores. Para una pyme que quiere ser citada y recomendada por ChatGPT, Perplexity o Gemini, lo normal es dejarlos entrar y enfocarse en tener buen contenido. El llms.txt es una propuesta prometedora pero todavía incierta: impleméntalo si quieres, sin esperar milagros.
Si no estás seguro de qué está permitiendo o bloqueando tu web hoy, en Normandia Web podemos revisar tu robots.txt, dejar tu sitio accesible para los rastreadores de IA correctos y asegurarnos de que nada esté cerrándote la puerta sin querer.
¿Listo para aplicarlo en tu empresa?
Cuéntanos qué te está costando tiempo, dinero o control. Te ayudamos a identificar por dónde empezar.
Iniciar asesoría →