Auditoría de visibilidad en IA: empieza por el acceso
Empieza tu auditoría de visibilidad en IA por el robots.txt: el 60% de los sitios reputados bloquea un rastreador. Las tres capas, en orden y con su coste.
Casi todos los equipos empiezan una auditoría de visibilidad en IA tecleando veinte prompts en ChatGPT y apuntando a quién nombran. Eso da la puntuación sin decir por qué, y se salta la única capa capaz de dejarla en cero ella sola.
Un estudio sobre archivos robots.txt publicado en octubre de 2025 encontró que el 60% de los sitios reputados bloquea al menos un rastreador de IA, frente al 23% de septiembre de 2023. Cuanto mejor es la reputación de tu dominio, más probable es que alguien de tu equipo ya cerrara la puerta.
Abajo está el orden que encuentra la causa en lugar del síntoma: primero el acceso, después lo que tu sitio le entrega a una máquina, y al final si la página se puede citar.
Tabla de contenidos
¿Qué es una auditoría de visibilidad en IA?
Una auditoría de visibilidad en IA comprueba si los motores de respuesta pueden llegar a tu sitio, leer lo que les ofrece y citar un pasaje limpio, revisado en ese orden para que un fallo en una capa explique las de arriba. Diagnostica la causa, mientras que el seguimiento de prompts reporta la puntuación.
La distinción importa porque las dos cosas se venden como si fueran la misma. Un panel que dice que apareces en el 4% de las respuestas es una medición, y una medición sin mecanismo detrás te deja adivinando cuál de una docena de motivos posibles aplica.
Revisar las capas en orden también ahorra dinero. La de acceso no cuesta nada y tarda minutos, así que encontrar ahí un rastreador bloqueado significa que estabas a punto de pagar una suscripción para ver un cero cuya causa ningún panel te habría enseñado.
Las tres capas, y por qué este orden
-
1
Acceso. Si el robots.txt cierra la puerta, las otras dos capas no se pueden ni medir. Minutos y cero coste.
-
2
Archivos. Qué encuentra la máquina cuando entra: llms.txt y precios en texto plano. Una tarde de trabajo.
-
3
Extractabilidad. Si el párrafo se sostiene fuera de su contexto. Es trabajo continuo, no una revisión puntual.
Fuente: criterios de auditoría de MARK, 2026
El orden no es una preferencia de estilo. Cada capa condiciona a la siguiente, de modo que optimizar párrafos en un sitio con GPTBot bloqueado es reescribir para un lector que tiene prohibido entrar.
Capa 1: ¿los rastreadores pueden entrar?
Abre tu robots.txt antes que nada. Si prohíbe los bots que usan los motores de respuesta, esos motores no pueden leer ni una página y todo lo que viene después es inmedible.
60%
de los sitios reputados prohíbe al menos un rastreador de IA, frente al 9,1% de los sitios de desinformación. Más del 50% bloquea GPTBot en concreto. Fuente: Steinacker-Olsztyn, Gosain y Dao, "Is Misinformation More Open?", 2025
Ese hallazgo tiene una forma incómoda. Los sitios que un motor de respuesta más querría citar son justo los que le cerraron la puerta, casi siempre por el valor por defecto de un plugin o por una regla general añadida en el pánico del scraping de 2023 y nunca revisada, como sugiere el salto del 23% al 60% en veinte meses. Puedes leer el estudio completo en arXiv.
Qué motor pierdes con cada user-agent
| User-agent | Motor | Qué cuesta bloquearlo |
|---|---|---|
| GPTBot, OAI-SearchBot | ChatGPT | Entrenamiento y citación, juntos |
| PerplexityBot | Perplexity | La citación, que es todo su modelo |
| ClaudeBot, anthropic-ai | Claude | La recuperación cuando navega |
| Google-Extended | Gemini y grounding | Solo Gemini, no el ranking de Search |
| CCBot | Common Crawl | Datasets de entrenamiento, sin citación |
Fuente: documentación pública de rastreadores de OpenAI, Anthropic, Perplexity y Google, septiembre de 2026
La última fila es la útil. Bloquear CCBot deja tus páginas fuera de los corpus de entrenamiento y a la vez libres a los bots de búsqueda y citación, que es la postura intermedia sensata para una marca que quiere salir nombrada sin alimentar al siguiente modelo.
No leas el archivo a ojo. Un robots.txt tiene grupos por user-agent, reglas Allow que ganan a Disallow y comodines, de forma que un grupo específico para PerplexityBot anula un bloqueo general puesto más arriba. Decirle a un cliente que está bloqueado cuando no lo está es afirmar algo falso sobre su propio sitio, y es un error fácil de cometer de un vistazo.
Capa 2: qué le entrega tu sitio a una máquina
Una vez que los rastreadores pueden entrar, la segunda capa pregunta qué se encuentran. Dos archivos de texto plano hacen casi todo el trabajo aquí, y los dos son opcionales en el sentido de que nada se rompe sin ellos.
Un llms.txt en la raíz dice qué hace tu producto, para quién es y dónde están las páginas importantes. Es un resumen escrito para un parser en lugar de para un visitante, y le ahorra a la máquina deducir tu posicionamiento a partir de una home de marketing.
Un pricing.md pesa más de lo que parece. Los agentes que comparan productos por encargo de un comprador descartan lo que no pueden leer, así que un precio detrás de "contacta con ventas" o renderizado por JavaScript te saca de la lista corta antes de que ningún humano lo vea.
Google dice con todas las letras en su guía de optimización para funciones de IA que ninguno de los dos archivos hace falta para AI Overviews ni para AI Mode, y conviene repetirlo para dimensionar bien el esfuerzo. Ayudan con los motores que no son Google y cuestan una tarde, así que trátalos como ganancia barata y no como el motivo de tu baja visibilidad.
Capa 3: ¿la página se puede citar?
La tercera capa es donde vive casi todo el trabajo recurrente, porque una página puede ser perfectamente rastreable y no salir citada nunca. Un motor levanta pasajes, no páginas, así que la unidad que tiene que sobrevivir al recorte es el párrafo.
Qué hace citable a un pasaje
La respuesta va primero
La pregunta de cada encabezado se contesta entera en sus dos primeras frases, sin depender de nada de más arriba.
Cada cifra con su fuente
Fuente y año en la misma frase que el número. Una estadística en una nota al pie es una estadística que nadie puede levantar.
Frases que se sostienen solas
"Es del 42%" obliga a saber de qué. "El NPS promedio en SaaS es del 42%" sobrevive a que lo citen suelto.
Lo comparable, en tabla
La prosa comparativa se extrae mal. Una tabla con el mismo contenido le da al motor filas que lee sin interpretar.
Fuente: criterios de contenido de MARK, 2026
Aprovecha y añade los datos estructurados. Un bloque de FAQ con su marcado de schema convierte cuatro párrafos en cuatro pares de pregunta y respuesta que una máquina puede tratar por separado, que es la diferencia entre contenido que se lee bien y contenido que se extrae.
Cómo hacer una auditoría de visibilidad en IA con MARK
La idea "¿Pueden leerte las IA?" ejecuta las dos primeras capas de una sola vez. Le pasas cualquier URL de tu sitio y te dice qué motores pueden llegar hoy, cuáles no, y qué le está ofreciendo tu dominio a una máquina.
Qué hace la auditoría, paso a paso
-
1
Trae tu robots.txt y lo interpreta con el parser del estándar, así los grupos por user-agent, las reglas Allow y los comodines se resuelven como los resuelve un rastreador.
-
2
Reporta por nombre qué motores entran y cuáles no, y pone CCBot aparte porque bloquear el entrenamiento y dejar la citación es una postura, no un error.
-
3
Comprueba llms.txt y pricing.md, y da por ausente un 200 que devuelve la página 404 de tu tema, que es como la mitad de estas revisiones da un falso aprobado.
-
4
Devuelve el veredicto en una línea y después ofrece la tercera capa: reescribir un artículo concreto para que sus pasajes se puedan extraer.
Fuente: flujo de auditoría de sitio de MARK, 2026
Dos decisiones de diseño merecen mención porque cambian qué haces con el resultado. Un bot bloqueado se presenta como una decisión tuya y no como un defecto a corregir, porque bloquear impide entrenamiento y citación a la vez y solo tú sabes qué intercambio le conviene a tu marca.
La auditoría además no consume créditos de artículo. Lee y reporta sin crear nada, lo que importa en una prueba donde cada pieza publicada descuenta de una cuota pequeña.
Lo que una auditoría no te va a decir
Una auditoría explica por qué podrían no citarte. No puede decirte si te citan, porque eso exige consultar los motores con tus prompts de forma programada y comparar contra competidores durante semanas.
Son dos productos distintos y el montaje honesto usa los dos. Las herramientas de visibilidad en IA arrancan alrededor de 29 USD al mes y te dan la puntuación, mientras que la auditoría te da el mecanismo que hay detrás.
El orden sigue favoreciendo a la auditoría. Pagar un rastreador antes de revisar el acceso es comprar un panel para confirmar un cero cuya causa llevaba meses en un archivo de texto, que es la forma más común de desperdiciar este presupuesto.
Por dónde empezar esta tarde
Abre tudominio.com/robots.txt en una pestaña ahora mismo y busca GPTBot. Esa única comprobación resuelve la capa que con más probabilidad te está costando todo en silencio, y tarda menos que leer este párrafo.
Si los rastreadores tienen permiso, pasa a la página que debería estar ganando tu consulta más valiosa y lee las dos primeras frases de cada encabezado. Ahí falla la mayoría, y el arreglo es reescribir en lugar de comprar nada.
MARK hace la auditoría de acceso, la revisión de archivos y la reescritura en el mismo sitio, y la optimización para motores generativos es la disciplina que automatiza. La prueba dura 14 días y ejecutar la auditoría no cuesta nada.
Preguntas frecuentes
¿Qué es una auditoría de visibilidad en IA?
Una auditoría de visibilidad en IA comprueba si los motores de respuesta pueden llegar a tu sitio, leer los archivos que les ofrece y citar un pasaje de tus páginas, revisado en ese orden. Diagnostica por qué apareces o no en las respuestas de IA, a diferencia del seguimiento de prompts, que mide con qué frecuencia apareces.
¿Cómo sé si mi sitio bloquea a los rastreadores de IA?
Abre tudominio.com/robots.txt y busca GPTBot, PerplexityBot, ClaudeBot y Google-Extended. Leerlo a ojo no es fiable porque los grupos por user-agent y las reglas Allow se pisan entre sí, de modo que un grupo específico puede anular un bloqueo general de más arriba; un parser que implemente el estándar da la respuesta que obtendría un rastreador de verdad.
¿Conviene bloquear a los rastreadores de IA?
Es una decisión de negocio antes que técnica, porque bloquear corta el entrenamiento y la citación al mismo tiempo. La postura intermedia habitual es bloquear CCBot, que alimenta datasets de entrenamiento, y dejar pasar a los bots de búsqueda y citación como GPTBot y PerplexityBot para que las respuestas puedan seguir nombrándote.
¿Necesito un archivo llms.txt?
Google afirma que llms.txt no hace falta para AI Overviews ni para AI Mode, así que por sí solo no va a arreglar una visibilidad baja. Ayuda a los motores que no son Google a entender qué es tu producto y dónde están tus páginas clave, y cuesta una tarde, lo que lo convierte en ganancia barata más que en una prioridad.
¿Cada cuánto conviene repetir la auditoría?
Repite la capa de acceso cada vez que alguien cambie de hosting, instale un plugin de SEO o edite el robots.txt, porque son los momentos en los que aparece una regla de rastreo sin que nadie la decida. La capa de página es trabajo continuo y no una revisión programada, porque cada artículo nuevo se puede extraer o no.