Saltar al contenido
IA / GEO

llms.txt y crawlers de IA: guía para tu web (GPTBot, Google-Extended…)

Qué son los crawlers de IA y el archivo llms.txt, cómo controlarlos en tu robots.txt y por qué es clave permitirlos para aparecer en ChatGPT, Perplexity o Google AI.

llms.txt y crawlers de IA: GPTBot, Google-Extended, PerplexityBot

Para que la IA te recomiende, primero tiene que poder leerte. Y ahí entran dos piezas técnicas que mucha gente pasa por alto: los crawlers de IA (los robots que rastrean tu web para los modelos) y el archivo llms.txt. Esta guía va de eso: cómo controlarlos para no quedarte fuera de las respuestas de IA. Es una parte técnica del GEO.

Qué crawlers de IA existen

Estos son los principales robots de IA y para qué sirven:

Crawler (user-agent)De quiénPara qué
GPTBotOpenAIRastreo para entrenamiento/productos de OpenAI
OAI-SearchBotOpenAIBúsqueda y citas en ChatGPT
Google-ExtendedGoogleUso de tu contenido en Gemini y respuestas con IA
PerplexityBotPerplexityRastreo y citación en Perplexity
ClaudeBotAnthropicRastreo para Claude

Si bloqueas a estos user-agents, esa IA no podrá citarte. Si los permites, abres la puerta a aparecer en sus respuestas.

Cómo controlar el acceso en tu robots.txt

El robots.txt (en la raíz de tu web) es donde das o quitas permiso. Para permitir que la IA te lea y te cite:

# Permitir crawlers de IA (para aparecer en sus respuestas)
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: PerplexityBot
Allow: /

Si por el contrario quisieras bloquear uno (por ejemplo, no permitir el uso para entrenamiento), sería:

User-agent: GPTBot
Disallow: /

Revisa tu robots.txt: es muy común bloquear sin querer a estos bots (o tenerlo demasiado restrictivo) y quedarse fuera de la IA sin saberlo.

Qué es el archivo llms.txt

llms.txt es una propuesta de estándar: un archivo de texto en la raíz de tu web (tudominio.com/llms.txt) pensado para que los modelos de IA entiendan de un vistazo qué eres y dónde está tu contenido clave. Un ejemplo sencillo:

# Tu Negocio — Agencia de X en Barcelona
> Ayudamos a negocios de Barcelona a conseguir más clientes con SEO y GEO.

## Servicios
- [Posicionamiento web en Barcelona](https://tudominio.com/servicios/seo/)
- [Agencia GEO](https://tudominio.com/agencia-geo/)

## Recursos
- [Guía: qué es el GEO](https://tudominio.com/blog/que-es-el-geo/)

Es un estándar emergente: la adopción aún está creciendo, pero como cuesta muy poco implementarlo y no perjudica, merece la pena tenerlo mientras el ecosistema madura.

¿Bloquear o permitir? La decisión clave

Aquí está el dilema: visibilidad frente a control.

  • Si tu objetivo es captar clientes y aparecer en ChatGPT, Perplexity o Google AI → permite los crawlers.
  • Solo tiene sentido bloquear si, por motivos concretos, no quieres que usen tu contenido bajo ningún concepto.

Para la inmensa mayoría de negocios, permitir compensa: no aparecer en la IA hoy es como no aparecer en Google hace 15 años.

Para negocios locales (Barcelona)

De poco sirve tener una ficha y un sitio impecables si la IA no puede rastrearlos. Revisar el acceso de los crawlers es de las primeras cosas que comprobamos en nuestra agencia GEO en Barcelona, junto con los datos estructurados que ayudan a la IA a entenderte.

En resumen

Antes de optimizar nada, asegúrate de que la IA puede leerte: permite los crawlers relevantes en tu robots.txt y añade un llms.txt. Es técnico, pero es la puerta de entrada al GEO.

¿Quieres que revisemos si tu web es accesible para la IA? Empieza por el análisis SEO gratis o habla con nuestra agencia GEO en Barcelona.

Preguntas frecuentes

Preguntas frecuentes

¿Qué es el archivo llms.txt?
Es una propuesta de estándar: un archivo de texto que colocas en la raíz de tu web (tudominio.com/llms.txt) con un resumen de tu negocio y enlaces a tu contenido más importante, en formato claro y legible para modelos de IA. Su objetivo es facilitar que la IA entienda y use tu contenido.
¿llms.txt ya lo usan las IA?
Es un estándar emergente: la adopción está creciendo pero aún no es universal. Como su coste de implementación es muy bajo y no perjudica, merece la pena tenerlo mientras el ecosistema madura.
¿Debo bloquear o permitir los crawlers de IA?
Depende de tu objetivo. Si quieres aparecer y ser citado en las respuestas de IA, debes PERMITIRLOS. Bloquearlos te hace invisible para esa IA. Solo tiene sentido bloquear si no quieres que usen tu contenido bajo ningún concepto.
¿Bloquear GPTBot evita que entrenen con mi contenido?
Bloquear GPTBot le indica a OpenAI que no rastree tu web para ciertos usos, pero también reduce tus opciones de aparecer en sus productos. Es un equilibrio: visibilidad frente a control. Para la mayoría de negocios que quieren captar clientes, permitir compensa.
Amadeo Tusell

Escrito por

Amadeo Tusell

Consultor SEO en Barcelona con más de 15 años posicionando negocios locales y nacionales. Más sobre mí →

Empieza hoy

Auditoría SEO Express — Gratis

Descubre en 48 h los 3 errores que más ventas te están costando. Sin compromiso y sin letra pequeña.

Quiero mi auditoría gratis
Llamar WhatsApp