# robots.txt de esmerit.com # # IMPORTANTE: Cloudflare inserta ANTES de este contenido su propio bloque # «# BEGIN Cloudflare Managed content ... # END Cloudflare Managed Content» # con la cabecera Content-Signal y con Disallow: / para los rastreadores de # entrenamiento (GPTBot, ClaudeBot, CCBot, Bytespider, meta-externalagent, # Amazonbot, Applebot-Extended, Google-Extended…). Ese bloque NO se puede # editar desde este proyecto: se gestiona en el panel de Cloudflare. # # Por eso este archivo NUNCA debe contener «Allow: /» para un agente que # Cloudflare bloquea: sería una regla contradictoria dentro del mismo fichero. # Todo lo que hay aquí va en la misma dirección que la política de Cloudflare. # # Política: sí a buscadores y a la búsqueda con IA (citas), no al entrenamiento. # ── 1. Buscadores clásicos ─────────────────────────────────────────────────── # La web HTML sí. Los "twins" en Markdown y los ficheros de descubrimiento para # agentes, no: son duplicados del contenido y no deben salir en Google/Bing. User-agent: Googlebot User-agent: Bingbot Disallow: /admin Disallow: /admin/ Disallow: /api/ Disallow: /auth/ Disallow: /respuesta Disallow: /oauth/ Disallow: /gracias Disallow: /gracias-vsl Disallow: /*.md$ Disallow: /*.md? Disallow: /llms.txt Disallow: /schema-map.xml Disallow: /.well-known/ Allow: / # ── 2. Buscadores con IA (respuesta y cita) ────────────────────────────────── # Sí acceden a llms.txt, schema-map.xml y /.well-known/: están hechos para # ellos. Los grupos de robots.txt no heredan del grupo «*», así que las rutas # privadas se repiten aquí. User-agent: OAI-SearchBot User-agent: ChatGPT-User User-agent: PerplexityBot User-agent: Perplexity-User User-agent: Claude-SearchBot User-agent: Claude-User Disallow: /admin Disallow: /admin/ Disallow: /api/ Disallow: /auth/ Disallow: /respuesta Disallow: /oauth/ Disallow: /gracias Disallow: /gracias-vsl Disallow: /landing Allow: / # ── 3. Rastreo para entrenamiento de modelos: bloqueado ────────────────────── # Misma dirección que el bloque gestionado por Cloudflare. Se repite aquí para # que la política siga en pie si algún día se desactiva en el panel. User-agent: GPTBot User-agent: ClaudeBot User-agent: CCBot User-agent: Bytespider User-agent: meta-externalagent User-agent: Meta-ExternalFetcher User-agent: cohere-ai User-agent: Google-Extended User-agent: Applebot-Extended User-agent: Amazonbot User-agent: Diffbot User-agent: Omgilibot User-agent: ImagesiftBot User-agent: Timpibot User-agent: AI2Bot User-agent: PanguBot User-agent: YouBot Disallow: / # ── 4. Resto de rastreadores ───────────────────────────────────────────────── User-agent: * Disallow: /admin Disallow: /admin/ Disallow: /api/ Disallow: /auth/ Disallow: /respuesta Disallow: /oauth/ Disallow: /gracias Disallow: /gracias-vsl Disallow: /*.md$ Disallow: /*.md? Disallow: /llms.txt Disallow: /schema-map.xml Disallow: /.well-known/ Allow: / # Único sitemap: el del dominio canónico. Las URLs del sitemap son todas de # https://esmerit.com, también cuando el archivo se sirve desde *.lovable.app. Sitemap: https://esmerit.com/sitemap.xml # Catálogo de recursos para agentes (AI catalog). Agentmap: https://esmerit.com/.well-known/ai-catalog.json