Un mapa con respaldo de fuente de recuperadores, agentes y controles de IA.
Este directorio separa los rastreadores automáticos, los recuperadores activados por el usuario y los tokens de control del editor utilizando la documentación actual del proveedor. Es una referencia para interpretar el tráfico de agentes de IA candidatos y la política de rastreadores, no una afirmación de que cada identidad listada ha visitado su tienda en línea.
Una cadena de user-agent no es prueba de identidad, y el comportamiento del proveedor puede cambiar. Verifique las solicitudes utilizando la IP actual del proveedor, DNS o la guía de autenticación donde esté disponible. La ausencia de una identidad listada no prueba el tráfico humano.
Entradas documentadas
16
Operadores representados
7
Fuentes verificadas
Aug 29, 2026
Fetchers y agentes activados por el usuario
5 entries- user triggered fetcher
ChatGPT-User
OpenAI
User-triggered fetcher used for certain actions in ChatGPT and Custom GPTs; it is not an automatic web crawler.
ChatGPT-User/1.0- Comportamiento de los robots
- OpenAI says robots.txt rules may not apply because these requests are user-initiated.
- Evidencia de identidad
- OpenAI publishes IP ranges for ChatGPT-User requests; the user-agent string remains spoofable.
- user triggered fetcher
Claude-User
Anthropic
Retrieves web content in response to user-initiated Claude requests.
Claude-User- Comportamiento de los robots
- Anthropic says its bots honor robots.txt directives, including Claude-User.
- Evidencia de identidad
- Anthropic's crawler guidance links a current source-IP list; do not trust the token alone.
- user triggered fetcher
Perplexity-User
Perplexity
User-triggered fetcher that may visit a page to help answer a Perplexity user's question; it is not used for web crawling or foundation-model training.
Perplexity-User/1.0- Comportamiento de los robots
- Perplexity says this fetcher generally ignores robots.txt because the request was initiated by a user.
- Evidencia de identidad
- Perplexity publishes IP ranges for Perplexity-User; combine the token and source IP rather than trusting the token alone.
- user triggered fetcher
Google-Agent
Google
Used by agents hosted on Google infrastructure to navigate the web and perform actions upon user request.
Google-Agent (browser-style user-agent string)- Comportamiento de los robots
- Google says user-triggered fetchers generally ignore robots.txt rules because the fetch was requested by a user.
- Evidencia de identidad
- Google publishes user-triggered-agent IP ranges and is experimenting with Web Bot Auth for the agent.bot.goog identity.
- user triggered fetcher
Amzn-User
Amazon
Supports user actions such as fetching current web information to answer Alexa queries on a user's behalf; Amazon says it is not used for generative-AI model training.
Amzn-User/0.1- Comportamiento de los robots
- Amazon says because Amzn-User actions can be user-initiated, it may not follow all robots.txt directives.
- Evidencia de identidad
- Amazon publishes IP addresses for Amzn-User; use source verification in addition to the token.
Rastreadores de búsqueda automáticos
5 entries- search crawler
OAI-SearchBot
OpenAI
Automatic crawler used to surface websites in ChatGPT search results.
OAI-SearchBot/1.4 (documented example; version may change)- Comportamiento de los robots
- Managed with the OAI-SearchBot token in robots.txt.
- Evidencia de identidad
- Match the token with OpenAI's published SearchBot IP ranges; a user-agent string alone is not proof.
- search crawler
Claude-SearchBot
Anthropic
Navigates the web to improve the relevance and accuracy of Claude search responses.
Claude-SearchBot- Comportamiento de los robots
- Anthropic says its bots honor robots.txt directives.
- Evidencia de identidad
- Anthropic's crawler guidance links a current source-IP list; do not trust the token alone.
- search crawler
PerplexityBot
Perplexity
Automatic crawler designed to surface and link websites in Perplexity search results; Perplexity says it is not used to crawl content for foundation-model training.
PerplexityBot/1.0- Comportamiento de los robots
- Perplexity recommends managing PerplexityBot through robots.txt.
- Evidencia de identidad
- Perplexity publishes IP ranges for PerplexityBot; combine the token and source IP rather than trusting the token alone.
- search crawler
Applebot
Apple
Apple web crawler used for search experiences including Spotlight, Siri, and Safari; Apple says crawled data may also support foundation-model training and current-content context for AI outputs.
Applebot/<version> within Apple's documented browser-style user-agent format- Comportamiento de los robots
- Applebot respects standard robots.txt directives in general search crawls.
- Evidencia de identidad
- Apple documents reverse-DNS verification under *.applebot.apple.com and publishes Applebot IP CIDR ranges.
- search crawler
Amzn-SearchBot
Amazon
Amazon search crawler used to improve search experiences in Amazon products and services, including eligibility for experiences such as Alexa; Amazon says it is not used for generative-AI model training.
Amzn-SearchBot/0.1- Comportamiento de los robots
- Amazon documents robots.txt allow/disallow support for its crawlers.
- Evidencia de identidad
- Amazon publishes IP addresses for Amzn-SearchBot; use source verification in addition to the token.
Rastreadores de desarrollo de modelos
2 entries- model development crawler
GPTBot
OpenAI
Automatic crawler for content that may be used to train OpenAI generative AI foundation models.
GPTBot/1.4 (documented example; version may change)- Comportamiento de los robots
- Managed separately with the GPTBot token in robots.txt.
- Evidencia de identidad
- Match the token with OpenAI's published GPTBot IP ranges; a user-agent string alone is not proof.
- model development crawler
ClaudeBot
Anthropic
Collects public web content that could potentially contribute to Anthropic model training.
ClaudeBot- Comportamiento de los robots
- Anthropic says its bots honor robots.txt directives.
- Evidencia de identidad
- Anthropic's crawler guidance links a current source-IP list; do not trust the token alone.
Rastreadores generales de proveedores
1 entry- general crawler
Amazonbot
Amazon
Amazon crawler used to improve products and services; Amazon says collected content may also be used to train Amazon AI models.
Amazonbot/0.1- Comportamiento de los robots
- Amazon documents robots.txt allow/disallow support for its crawlers.
- Evidencia de identidad
- Amazon publishes IP addresses for Amazonbot; use source verification in addition to the token.
Tokens de control de editor
2 entries- control token
Google-Extended
Google
Publisher control for whether Google-crawled content may be used for future Gemini model training and specified grounding uses.
robots.txt token; no separate HTTP request user-agent- Comportamiento de los robots
- Google-Extended is a robots.txt product-control token and does not affect Google Search inclusion or ranking.
- Evidencia de identidad
- Not a request identity. Do not look for Google-Extended as a standalone HTTP user-agent in traffic logs.
- control token
Applebot-Extended
Apple
Publisher control for whether Applebot-crawled content may be used to train Apple's general-purpose foundation models.
robots.txt control token; does not crawl webpages- Comportamiento de los robots
- Applebot-Extended is configured in robots.txt but does not itself crawl webpages.
- Evidencia de identidad
- Not a request identity. Traffic should be attributed to Applebot, not Applebot-Extended.
Rastreadores de corpus web abiertos
1 entry- web corpus crawler
CCBot
Common Crawl
Automated crawler that collects public web data for Common Crawl's open web-crawl repository.
CCBot/2.0- Comportamiento de los robots
- Common Crawl documents robots.txt support for CCBot.
- Evidencia de identidad
- Common Crawl publishes dedicated IP ranges and reverse-DNS guidance; the project also warns that clients can falsely claim the CCBot user-agent.
No se deben colapsar tres clases en una sola etiqueta de "bot".
Rastreadores automáticos
Search and model-development crawlers operate automatically and are generally managed through provider-specific robots.txt policy.
Buscadores activados por el usuario
These requests happen because a user or agent asked a provider to retrieve or act on a page. Robots behavior can differ materially from automatic crawlers.
Tokens de control
Google-Extended and Applebot-Extended are publisher controls, not standalone HTTP crawler identities. They should not be treated as traffic labels.
Lo que este directorio establece — y lo que no.
- Registra las identidades y los controles que los proveedores nombrados documentaron cuando se revisó esta página.
- No establece que una solicitud que contenga una de estas cadenas sea legítima; las cadenas pueden ser falsificadas.
- No establece que el tráfico no reconocido sea humano.
- No establece lo que un modelo de IA externo concluyó, prefirió, recomendó, comparó o decidió.
Documentación del proveedor verificada 2026-08-29 · Vuelva a verificar la fuente primaria vinculada antes de la aplicación operativa
Cartograph se está construyendo en torno a la evidencia, no a la confianza del agente de usuario.
La capa de evidencia planificada tiene como objetivo mantener separadas la identidad declarada, la evidencia de verificación, la actividad observada de la tienda y las incógnitas. Cartograph no es un bloqueador de bots, WAF o herramienta de aplicación de tráfico.