llms.txt y crawlers de IA: guía para tu web (GPTBot, Google-Extended…)
Qué son los crawlers de IA y el archivo llms.txt, cómo controlarlos en tu robots.txt y por qué es clave permitirlos para aparecer en ChatGPT, Perplexity o Google AI.
Para que la IA te recomiende, primero tiene que poder leerte. Y ahí entran dos piezas técnicas que mucha gente pasa por alto: los crawlers de IA (los robots que rastrean tu web para los modelos) y el archivo llms.txt. Esta guía va de eso: cómo controlarlos para no quedarte fuera de las respuestas de IA. Es una parte técnica del GEO.
Qué crawlers de IA existen
Estos son los principales robots de IA y para qué sirven:
| Crawler (user-agent) | De quién | Para qué |
|---|---|---|
| GPTBot | OpenAI | Rastreo para entrenamiento/productos de OpenAI |
| OAI-SearchBot | OpenAI | Búsqueda y citas en ChatGPT |
| Google-Extended | Uso de tu contenido en Gemini y respuestas con IA | |
| PerplexityBot | Perplexity | Rastreo y citación en Perplexity |
| ClaudeBot | Anthropic | Rastreo para Claude |
Si bloqueas a estos user-agents, esa IA no podrá citarte. Si los permites, abres la puerta a aparecer en sus respuestas.
Cómo controlar el acceso en tu robots.txt
El robots.txt (en la raíz de tu web) es donde das o quitas permiso. Para permitir que la IA te lea y te cite:
# Permitir crawlers de IA (para aparecer en sus respuestas)
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
Si por el contrario quisieras bloquear uno (por ejemplo, no permitir el uso para entrenamiento), sería:
User-agent: GPTBot
Disallow: /
Revisa tu robots.txt: es muy común bloquear sin querer a estos bots (o tenerlo demasiado restrictivo) y quedarse fuera de la IA sin saberlo.
Qué es el archivo llms.txt
llms.txt es una propuesta de estándar: un archivo de texto en la raíz de tu web (tudominio.com/llms.txt) pensado para que los modelos de IA entiendan de un vistazo qué eres y dónde está tu contenido clave. Un ejemplo sencillo:
# Tu Negocio — Agencia de X en Barcelona
> Ayudamos a negocios de Barcelona a conseguir más clientes con SEO y GEO.
## Servicios
- [Posicionamiento web en Barcelona](https://tudominio.com/servicios/seo/)
- [Agencia GEO](https://tudominio.com/agencia-geo/)
## Recursos
- [Guía: qué es el GEO](https://tudominio.com/blog/que-es-el-geo/)
Es un estándar emergente: la adopción aún está creciendo, pero como cuesta muy poco implementarlo y no perjudica, merece la pena tenerlo mientras el ecosistema madura.
¿Bloquear o permitir? La decisión clave
Aquí está el dilema: visibilidad frente a control.
- Si tu objetivo es captar clientes y aparecer en ChatGPT, Perplexity o Google AI → permite los crawlers.
- Solo tiene sentido bloquear si, por motivos concretos, no quieres que usen tu contenido bajo ningún concepto.
Para la inmensa mayoría de negocios, permitir compensa: no aparecer en la IA hoy es como no aparecer en Google hace 15 años.
Para negocios locales (Barcelona)
De poco sirve tener una ficha y un sitio impecables si la IA no puede rastrearlos. Revisar el acceso de los crawlers es de las primeras cosas que comprobamos en nuestra agencia GEO en Barcelona, junto con los datos estructurados que ayudan a la IA a entenderte.
En resumen
Antes de optimizar nada, asegúrate de que la IA puede leerte: permite los crawlers relevantes en tu robots.txt y añade un llms.txt. Es técnico, pero es la puerta de entrada al GEO.
¿Quieres que revisemos si tu web es accesible para la IA? Empieza por el análisis SEO gratis o habla con nuestra agencia GEO en Barcelona.
Preguntas frecuentes
¿Qué es el archivo llms.txt?
¿llms.txt ya lo usan las IA?
¿Debo bloquear o permitir los crawlers de IA?
¿Bloquear GPTBot evita que entrenen con mi contenido?
Escrito por
Amadeo Tusell
Consultor SEO en Barcelona con más de 15 años posicionando negocios locales y nacionales. Más sobre mí →