llms.txt i crawlers de IA: guia per al teu web (GPTBot, Google-Extended…)
Què són els crawlers de IA i el fitxer llms.txt, com controlar-los al teu robots.txt i per què és clau permetre'ls per aparèixer a ChatGPT, Perplexity o Google AI.
Perquè la IA et recomani, primer ha de poder llegir-te. I aquí entren dues peces tècniques que molta gent passa per alt: els crawlers de IA (els robots que rastregen el teu web per als models) i el fitxer llms.txt. Aquesta guia va d’això: com controlar-los per no quedar-te fora de les respostes de IA. És una part tècnica del GEO.
Quins crawlers de IA existeixen
Aquests són els principals robots de IA i per a què serveixen:
| Crawler (user-agent) | De qui | Per a què |
|---|---|---|
| GPTBot | OpenAI | Rastreig per a entrenament/productes d’OpenAI |
| OAI-SearchBot | OpenAI | Cerca i cites a ChatGPT |
| Google-Extended | Ús del teu contingut a Gemini i respostes amb IA | |
| PerplexityBot | Perplexity | Rastreig i citació a Perplexity |
| ClaudeBot | Anthropic | Rastreig per a Claude |
Si bloqueges aquests user-agents, aquesta IA no podrà citar-te. Si els permets, obres la porta a aparèixer a les seves respostes.
Com controlar l’accés al teu robots.txt
El robots.txt (a l’arrel del teu web) és on dones o treus permís. Per permetre que la IA et llegeixi i et citi:
# Permetre crawlers de IA (per aparèixer a les seves respostes)
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
Si per contra volguessis bloquejar-ne un (per exemple, no permetre l’ús per a entrenament), seria:
User-agent: GPTBot
Disallow: /
Revisa el teu robots.txt: és molt comú bloquejar sense voler aquests bots (o tenir-lo massa restrictiu) i quedar-se fora de la IA sense saber-ho.
Què és el fitxer llms.txt
llms.txt és una proposta d’estàndard: un fitxer de text a l’arrel del teu web (eldomini.com/llms.txt) pensat perquè els models de IA entenguin d’un cop d’ull què ets i on és el teu contingut clau. Un exemple senzill:
# El teu Negoci — Agència de X a Barcelona
> Ajudem negocis de Barcelona a aconseguir més clients amb SEO i GEO.
## Serveis
- [Posicionament web a Barcelona](https://eldomini.com/serveis/seo/)
- [Agència GEO](https://eldomini.com/agencia-geo/)
## Recursos
- [Guia: què és el GEO](https://eldomini.com/blog/que-es-el-geo/)
És un estàndard emergent: l’adopció encara està creixent, però com que costa molt poc implementar-lo i no perjudica, val la pena tenir-lo mentre l’ecosistema madura.
Bloquejar o permetre? La decisió clau
Aquí està el dilema: visibilitat versus control.
- Si el teu objectiu és captar clients i aparèixer a ChatGPT, Perplexity o Google AI → permet els crawlers.
- Només té sentit bloquejar si, per motius concrets, no vols que facin servir el teu contingut de cap manera.
Per a la immensa majoria de negocis, permetre compensa: no aparèixer a la IA avui és com no aparèixer a Google fa 15 anys.
Per a negocis locals (Barcelona)
De poc serveix tenir una fitxa i un lloc impecables si la IA no pot rastrejar-los. Revisar l’accés dels crawlers és de les primeres coses que comprovem a la nostra agència GEO a Barcelona, juntament amb les dades estructurades que ajuden la IA a entendre’t.
En resum
Abans d’optimitzar res, assegura’t que la IA pot llegir-te: permet els crawlers rellevants al teu robots.txt i afegeix un llms.txt. És tècnic, però és la porta d’entrada al GEO.
Vols que revisem si el teu web és accessible per a la IA? Comença per l’anàlisi SEO gratis o parla amb la nostra agència GEO a Barcelona.
Preguntes freqüents
Què és el fitxer llms.txt?
llms.txt ja el fan servir les IA?
He de bloquejar o permetre els crawlers de IA?
Bloquejar GPTBot evita que entrenin amb el meu contingut?
Escrit per
Amadeo Tusell
Consultor SEO a Barcelona amb més de 15 anys posicionant negocis locals i nacionals. Més sobre mi →