llms.txt y rastreadores de IA: qué es, qué dicen los motores y cómo tratar a GPTBot, ClaudeBot y compañía en robots.txt
llms.txt es un fichero de texto en Markdown, propuesto por Jeremy Howard (Answer.AI) el 3 de septiembre de 2024, que resume un sitio para que un modelo de lenguaje lo entienda. Ningún motor de IA ha declarado que lo use para decidir qué citar; Google ha dicho que ningún sistema de IA lo usa. Lo que sí controla tu visibilidad es robots.txt: cada empresa tiene un rastreador para entrenar (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) y otro para buscar y citar (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Bloquear el primero no te saca de las respuestas; bloquear el segundo, sí.
Hay dos ficheros de texto en la raíz de tu web que salen en cualquier conversación sobre IA y visibilidad: llms.txt, que es nuevo y del que se habla mucho, y robots.txt, que tiene treinta años y del que depende de verdad que un motor pueda citarte. Este artículo explica qué es cada uno, qué han dicho los motores, qué rastreadores existen y para qué sirve cada uno, y qué poner en robots.txt según lo que quieras. Todo lo que afirmamos sobre un rastreador sale de la documentación oficial de su empresa, enlazada al final.
Qué es llms.txt
llms.txt es una propuesta para colocar en la raíz de un sitio web (/llms.txt) un fichero en Markdown que explique en pocas líneas qué es el sitio y enlace a sus páginas importantes, en un formato que un modelo de lenguaje pueda leer sin pelearse con menús, banners y scripts. La propuso Jeremy Howard, cofundador de Answer.AI y fast.ai, el 3 de septiembre de 2024 en llmstxt.org.
El formato es sencillo: un título H1 con el nombre del sitio, una cita en bloque con un resumen, y secciones H2 con listas de enlaces y una descripción de cada uno. La propuesta recomienda además publicar versiones en Markdown limpio de las páginas que un agente pueda necesitar (por ejemplo, añadiendo .md a la URL). Muchas plataformas de documentación lo generan de forma automática, y llmstxt.org señala que los propios laboratorios (OpenAI, Anthropic y Google) publican uno para su documentación de desarrolladores.
Conviene tener claro para qué se pensó: para documentación técnica que un agente de programación consulta durante una tarea. No se pensó para que ChatGPT decida qué fontanero recomendar en Móstoles.
Qué dicen los motores sobre llms.txt
Ningún motor de búsqueda ni de respuesta con IA ha dicho que use llms.txt para decidir qué páginas leer o citar. A fecha de esta consulta no hemos encontrado ninguna declaración oficial de OpenAI, Anthropic, Perplexity ni Google que lo diga; y en sentido contrario sí la hay: John Mueller, de Google, escribió en Bluesky el 17 de junio de 2025 que «ningún sistema de IA usa actualmente llms.txt», y añadió que, mirando los registros del servidor, los chatbots buscan tus páginas pero no piden ese fichero.
FWIW no AI system currently uses llms.txt.
Google, además, es explícito sobre sus funciones de IA: «no hay requisitos adicionales para aparecer en AI Overviews o en AI Mode, ni son necesarias otras optimizaciones especiales». Hace falta lo mismo que para la búsqueda normal: estar indexado y poder mostrarse con un fragmento.
Nuestra recomendación: publicar un llms.txt no hace daño, cuesta diez minutos y puede ayudar a un agente que llegue a tu web con una tarea. Pero no es una técnica de visibilidad y no sustituye a nada. Si solo vas a hacer una cosa, revisa robots.txt.
Los rastreadores de IA que importan y para qué sirve cada uno
Cada empresa de IA tiene varios agentes con nombres y funciones distintas, y lo que decides para uno no aplica al otro. Esta es la lista, con la función que declara cada empresa en su documentación.
| Rastreador | Empresa | Para qué sirve | ¿Respeta robots.txt? |
|---|---|---|---|
| GPTBot | OpenAI | Recoger contenido que puede usarse para entrenar sus modelos | Sí |
| OAI-SearchBot | OpenAI | Mostrar sitios en los resultados de las funciones de búsqueda de ChatGPT | Sí. Si lo bloqueas, tu web no aparece en las respuestas de búsqueda de ChatGPT |
| ChatGPT-User | OpenAI | Visitar una página concreta cuando un usuario lo pide en la conversación | OpenAI avisa de que, al iniciarlo un usuario, las reglas pueden no aplicarse. No decide si sales en la búsqueda |
| ClaudeBot | Anthropic | Recoger contenido para entrenar sus modelos | Sí |
| Claude-SearchBot | Anthropic | Mejorar la calidad de los resultados de búsqueda de Claude | Sí |
| Claude-User | Anthropic | Acceder a una web cuando un usuario de Claude lo pide | Sí. Bloquearlo impide que Claude lea tu web cuando un usuario lo pide |
| PerplexityBot | Perplexity | Indexar y enlazar sitios en los resultados de Perplexity. No se usa para entrenar modelos | Sí |
| Perplexity-User | Perplexity | Visitar una página cuando un usuario pregunta algo | Perplexity dice que, al pedirlo un usuario, «generalmente ignora» robots.txt |
| Google-Extended | Token para decidir si tu contenido se usa para entrenar Gemini y para grounding en Gemini y Vertex AI | Sí. No afecta a la inclusión ni al ranking en Google, ni a AI Overviews | |
| Applebot-Extended | Apple | Token para decidir si lo que rastrea Applebot se usa para entrenar sus modelos. No rastrea por sí mismo | Sí. No afecta a la búsqueda de Siri y Spotlight |
Fuente: documentación oficial de OpenAI, Anthropic, Perplexity, Google y Apple, consultada el 23 de septiembre de 2026. Los nombres son los que hay que escribir en User-agent.
Fíjate en un detalle: los agentes «de usuario» (ChatGPT-User, Claude-User, Perplexity-User) se comportan como si fueras tú abriendo la página en un navegador, y por eso dos de las tres empresas avisan de que pueden no seguir robots.txt. No son rastreadores masivos: visitan una URL concreta cuando alguien la pide.
Bloquear el entrenamiento no es bloquear la búsqueda
La confusión más cara que vemos es bloquear «la IA» en bloque para proteger el contenido y, sin querer, desaparecer de las respuestas. Cada empresa separa las dos cosas con agentes distintos, precisamente para que puedas decidir por separado.
- Entrenamiento: GPTBot, ClaudeBot, Google-Extended y Applebot-Extended. Bloquearlos dice «no uses mi contenido para entrenar modelos». No te quita de ninguna respuesta con búsqueda.
- Búsqueda y citación: OAI-SearchBot, Claude-SearchBot y PerplexityBot. Bloquearlos dice «no me muestres en tus resultados». OpenAI lo escribe sin rodeos: los sitios que bloquean OAI-SearchBot «no se mostrarán en las respuestas de búsqueda de ChatGPT».
- Google es un caso aparte: AI Overviews y AI Mode se alimentan del índice normal de Googlebot. Google-Extended solo controla el entrenamiento y el grounding de Gemini y Vertex AI, y Google afirma que no afecta a la inclusión ni al ranking en la búsqueda.
Qué poner en robots.txt según lo que quieras
robots.txt es un fichero de texto en la raíz del dominio con bloques User-agent y reglas Allow y Disallow. Los rastreadores que hemos listado declaran respetarlo, salvo los agentes de usuario que avisan de lo contrario. Tres configuraciones habituales, de la más abierta a la más cerrada.
Quiero salir en todas las respuestas y no me importa el entrenamiento
No pongas nada específico para estos agentes. Un robots.txt que solo bloquee lo de siempre (carpetas de administración, resultados de búsqueda interna) deja pasar a todos. Es lo que recomendamos a la mayoría de negocios de servicios: su contenido no es un activo que proteger, es su escaparate.
Quiero salir en las respuestas pero no alimentar el entrenamiento
Bloquea solo los agentes de entrenamiento y deja pasar a los de búsqueda. En robots.txt sería, un bloque por agente: «User-agent: GPTBot» con «Disallow: /»; lo mismo para ClaudeBot, Google-Extended y Applebot-Extended. Y nada para OAI-SearchBot, Claude-SearchBot ni PerplexityBot, que así siguen entrando. Es la configuración de la mayoría de medios que hemos revisado.
No quiero que ninguna IA lea mi web
Bloquea todos los de la tabla, de entrenamiento y de búsqueda. Asume las consecuencias: tu web no saldrá en ChatGPT, Claude ni Perplexity cuando alguien pregunte por tu sector, y los agentes de usuario pueden entrar igual si una persona pide tu URL. Google seguirá mostrándote en AI Overviews mientras estés indexado, salvo que uses nosnippet o noindex, que son los controles que Google indica para sus funciones de IA.
Dos precauciones. Primera: los nombres importan; «GPTbot» con minúscula o «OpenAI-SearchBot» no bloquean nada. Segunda: robots.txt es una petición educada, no una cerradura; para un bloqueo real hace falta hacerlo en el servidor o en el CDN, y ahí es donde suelen aparecer los bloqueos accidentales.
¿Tu web deja leer a los rastreadores?
El diagnóstico gratis comprueba si OAI-SearchBot, ClaudeBot, PerplexityBot y Google-Extended pueden leer tu web y si los cuatro motores te nombran.
Quiero mi diagnóstico gratisY entonces, ¿publico llms.txt o no?
Publícalo si te cuesta poco, sin esperar nada de él. Un llms.txt con el nombre del negocio, dos líneas de qué haces y dónde, y enlaces a tus cinco páginas de servicio no molesta y puede servir a un agente. Lo que decide si te citan es otra cosa: que los rastreadores de búsqueda puedan entrar, que tus páginas contesten preguntas de compra con datos, y que estés en las fuentes que los motores leen. Lo explicamos en cómo aparecer en ChatGPT, y los términos que aparecen por el camino están en el glosario.
Preguntas frecuentes
¿Qué es llms.txt?
Un fichero en Markdown en la raíz de una web (/llms.txt) que resume el sitio y enlaza a sus páginas importantes para que un modelo de lenguaje lo lea sin ruido. Lo propuso Jeremy Howard (Answer.AI) el 3 de septiembre de 2024. Está pensado sobre todo para documentación técnica.
¿ChatGPT o Google usan llms.txt?
Ninguno lo ha dicho. John Mueller, de Google, afirmó en junio de 2025 que ningún sistema de IA lo usa. Google indica que no hay requisitos especiales para aparecer en AI Overviews más allá de estar indexado. Publicarlo no hace daño, pero no cambia si te citan.
¿Bloquear GPTBot me saca de ChatGPT?
No. GPTBot recoge contenido para entrenar. El agente que decide si sales en las respuestas con búsqueda es OAI-SearchBot; OpenAI dice que los sitios que lo bloquean no se muestran en las respuestas de búsqueda de ChatGPT. Puedes bloquear uno y dejar pasar al otro.
¿Google-Extended afecta a mi posición en Google?
No. Google afirma que Google-Extended no afecta a la inclusión ni al ranking en la búsqueda. Controla si tu contenido se usa para entrenar Gemini y para grounding en Gemini y Vertex AI. AI Overviews y AI Mode se alimentan del índice normal de Googlebot.
¿Qué rastreador uso para Perplexity?
PerplexityBot es el que indexa y enlaza sitios en sus resultados, y Perplexity declara que no lo usa para entrenar modelos. Perplexity-User visita una página cuando un usuario lo pide y, según Perplexity, generalmente ignora robots.txt.
¿Cómo sé si mi web bloquea a los rastreadores de IA sin querer?
Con el comprobador de MencionIA (/comprobador), que pide tu web como cada rastreador y te dice quién puede leerla. Revisa también los ajustes de «bloquear bots de IA» de tu plugin de seguridad o tu CDN, que suelen cortar búsqueda y entrenamiento a la vez.
Fuentes
- llmstxt.org: The /llms.txt file (Jeremy Howard, 3 de septiembre de 2024) — consultado el 23 de septiembre de 2026
- Search Engine Roundtable: Google says no AI system currently uses llms.txt (John Mueller, Bluesky, 17 de junio de 2025) — consultado el 23 de septiembre de 2026
- OpenAI: Overview of OpenAI crawlers (GPTBot, OAI-SearchBot, ChatGPT-User) — consultado el 23 de septiembre de 2026
- Anthropic: Does Anthropic crawl data from the web, and how can site owners block the crawler? (ClaudeBot, Claude-SearchBot, Claude-User) — consultado el 23 de septiembre de 2026
- Perplexity: Crawlers (PerplexityBot, Perplexity-User) — consultado el 23 de septiembre de 2026
- Google Search Central: Overview of Google crawlers and fetchers (Google-Extended) — consultado el 23 de septiembre de 2026
- Google Search Central: AI features and your website — consultado el 23 de septiembre de 2026
- Apple: About Applebot (Applebot-Extended) — consultado el 23 de septiembre de 2026
Artículos relacionados
Cómo aparecer en ChatGPT: guía práctica para una pyme española
Qué mira ChatGPT para recomendar un negocio, qué puedes hacer desde tu web y tus fichas, qué no sirve de nada y cómo medir si te nombra. Guía para pymes.
Qué es el GEO (optimización para motores generativos) y en qué se diferencia del SEO
El GEO es el trabajo para que ChatGPT, Gemini, Perplexity o Claude nombren tu negocio en sus respuestas. Qué es, de dónde viene el término, tabla frente al SEO y qué es el AEO.
Herramientas para medir la visibilidad en ChatGPT y otras IAs: comparativa con precios verificados
Comparamos MencionIA, Profound, Peec AI, Otterly, Semrush, Ahrefs Brand Radar, Mentio, LLM Pulse, Adsmurai, AIrketing y AI Rank: para quién es cada una, precio de entrada y qué hace bien.
También disponible en inglés: llms.txt and AI Crawlers: What to Allow, What to Block, and What Actually Works