¿Cómo elige ChatGPT las fuentes que cita?
Qué documenta OpenAI sobre la búsqueda de ChatGPT, qué rastreador usa, cómo verificar el acceso y qué muestran mis datos del Observatorio y del benchmark.
Publicado el
Respuesta directa
ChatGPT arma la respuesta a partir de una búsqueda propia, y OpenAI documenta que devuelve citas en línea junto con un conjunto de URL recuperadas más amplio que el que llega a mostrar. El acceso a esa búsqueda depende de un agente específico, OAI-SearchBot, separado del que alimenta el entrenamiento de los modelos. En el Observatorio, 2.066 de las 2.076 respuestas de ChatGPT del corte de setiembre de 2026 llegaron con al menos un dominio citado.
Qué documenta OpenAI
OpenAI documenta cuatro agentes con funciones separadas: OAI-SearchBot para aparecer en los resultados de búsqueda de ChatGPT, GPTBot para el entrenamiento de sus modelos, OAI-AdsBot para validar la seguridad de páginas enviadas como anuncios, y ChatGPT-User para acciones iniciadas por la persona. Sobre este último aclara algo que conviene leer con atención: ChatGPT-User no determina si el contenido puede aparecer en búsqueda1. Una visita de ChatGPT-User a una página, entonces, dice poco sobre la presencia de esa página en la superficie de búsqueda.
Del lado de la respuesta, OpenAI documenta que su herramienta de búsqueda web devuelve citas en línea por omisión, más anotaciones con la URL, el título y la ubicación de cada fuente, y un campo aparte con todas las URL recuperadas, que suele ser más amplio que las citas mostradas2. Esa distancia entre lo recuperado y lo citado es la parte medible del proceso: un dominio puede entrar al contexto de la respuesta sin terminar en una cita visible.
OpenAI exige además que, al mostrar resultados web a una persona, las citas en línea queden visibles y se puedan clicar2. La obligación corre sobre quien construye la interfaz.
Qué rastreador usa y cómo verificar el acceso
El agente de la superficie de búsqueda es OAI-SearchBot. La verificación es de robots.txt y se hace en dos pasos, sin herramientas.
El primero es de permiso por agente. Un `Disallow` que alcance a OAI-SearchBot deja al sitio fuera de los resultados de búsqueda de ChatGPT, con independencia de la calidad del contenido. Como los agentes están separados por función, un sitio puede permitir OAI-SearchBot y bloquear GPTBot: la decisión sobre búsqueda y la decisión sobre entrenamiento son distintas y se escriben por separado1.
El segundo es de coherencia. Un bloque genérico con `User-agent: *` alcanza a OAI-SearchBot salvo que exista un bloque propio para ese agente, así que un sitio que cree haber permitido la búsqueda puede estar cerrándola desde una regla general escrita antes.
Qué muestran mis datos para ChatGPT
En el Observatorio de marcas en IA, que consulta el producto real de ChatGPT, 2.066 de las 2.076 respuestas del modelo llegaron con al menos un dominio citado en el corte de setiembre de 2026. La exposición de fuentes, en esa superficie y con ese método de recolección, es prácticamente total.
El contraste con mi propia medición del benchmark semanal es lo que vale la pena entender. El benchmark consulta la API del modelo y guarda las URL que el texto de la respuesta escribe. Sobre la ventana de cuatro semanas cerrada el 21 de setiembre de 2026, el recuento de respuestas con una URL en el texto quedó en cero sobre 5.893 respuestas de ChatGPT por API.
Las dos cifras describen el mismo modelo y miden cosas distintas. La primera mide lo que el producto muestra al público. La segunda mide lo que el modelo escribe en su prosa cuando se lo consulta por API sin búsqueda. Cualquier informe sobre fuentes de ChatGPT tiene que decir cuál de las dos superficies midió, y eso vale también para los informes de terceros.
Según un estudio de Profound, empresa que vende analítica de visibilidad en IA, sobre 680 millones de citas entre agosto de 2024 y junio de 2025, Wikipedia reunió el 7,8 % de las citas de ChatGPT y el 47,9 % de su top 10 de fuentes3. Según un estudio de Semrush, empresa que vende software de SEO, sobre más de 230.000 prompts entre julio y octubre de 2025, las tasas de Reddit y de Wikipedia en ChatGPT se movieron con fuerza semana a semana4. Los dos paneles son propios y no comparables entre sí.
Cómo lo mido
Corro un banco de prompts sin marca sobre el rubro, repetido varias veces, y registro dos series por respuesta: qué marcas se nombran y qué dominios se citan. Para ChatGPT mido sobre el producto, que es donde aparecen las fuentes, y dejo asentado el método de recolección junto con cada cifra.
Antes de la primera corrida hago la verificación de acceso de la sección anterior, una sola vez, y la repito cada vez que cambia el robots.txt.
Comparo siempre dentro del mismo modelo y de la misma ventana. Un promedio entre modelos esconde el caso de la marca que aparece seguido en uno y desaparece en otro, y una comparación entre ventanas distintas mezcla cambios del sitio con cambios del propio motor.
Cómo aumentar tus chances de que ChatGPT te cite
1. Revisa que OAI-SearchBot pueda entrar a tu sitio. Es el agente de la superficie de búsqueda, distinto del de entrenamiento, así que puedes permitir uno y bloquear el otro según lo que decidas.
2. Fíjate también en las reglas generales de tu robots.txt, que pueden estar alcanzándolo sin querer. Un bloque con asterisco escrito hace años alcanza a OAI-SearchBot salvo que exista un bloque propio para él.
3. Mide sobre el producto real de ChatGPT y deja la API para otra cosa. Te conviene porque las fuentes aparecen en el producto, y una medición por API sin búsqueda describe otra superficie.
4. Guarda el método de recolección junto a cada cifra que publiques. Sin eso, dos mediciones del mismo sitio dejan de compararse entre sí y la serie pierde sentido.
5. Trabaja las páginas que responden preguntas del rubro, con la respuesta arriba. Es lo que una búsqueda intermedia corta puede recuperar y mostrar sin tener que leer todo el sitio.
Qué módulos de AuraMetrics lo resuelven
Medir la marca propia con los mismos prompts del rubro. Prompt Tracking corre prompts en los cinco motores.
Ver qué fuentes cita la IA cuando responde sobre el rubro. Prompt Tracking muestra, para cada prompt y modelo, las fuentes que la respuesta citó, y AI Market Leaders las agrupa por marca.
Revisar las señales técnicas del sitio con el GEO Score y el Marco GEO. El GEO Score puntúa el sitio de 0 a 100 en los cuatro pilares del Marco GEO.
Preguntas frecuentes
¿Qué necesita una herramienta para rastrear la visibilidad de una marca en ChatGPT, Gemini y Perplexity?
El rastreo de visibilidad en la búsqueda de ChatGPT necesita tres piezas: un banco fijo de prompts, repetición por modelo, y el registro del método de recolección junto a cada cifra. Sin esas tres, dos corridas del mismo sitio quedan sin comparar.
¿Cómo tiene que funcionar una alerta de visibilidad de marca en IA?
Una alerta útil compara la misma marca contra sus propias corridas anteriores, dentro del mismo modelo y con la misma ventana. Comparar entre motores o entre ventanas distintas produce avisos que describen el cambio del método antes que el cambio del sitio.
Para la frecuencia con la que una marca aparece en ChatGPT, con sus métodos y sus opciones, está la guía de medición de frecuencia de marca en ChatGPT.
Cómo lo medí
Observatorio de marcas en IA: banco fijo de prompts sin marca sobre 35 rubros de Uruguay, tres repeticiones por modelo, consultando el producto real de ChatGPT. Corte de setiembre de 2026, leído el 24 de setiembre de 2026: 2.076 respuestas de ChatGPT, 2.066 con al menos un dominio citado. El Observatorio lleva tres cortes; las cifras de esta guía son del último.
Benchmark semanal: ventana de cuatro semanas cerrada el 21 de setiembre de 2026, 5.893 respuestas de ChatGPT por API. Las URL se extraen del texto de la respuesta con una expresión regular, así que el recuento describe lo que el modelo escribió en su prosa.
Fuentes
- 1. Overview of OpenAI Crawlers (se abre en una pestaña nueva). OpenAI. Sin fecha en la página. Consultado el 24 de setiembre de 2026.
- 2. Web search (se abre en una pestaña nueva). OpenAI. Sin fecha en la página. Consultado el 24 de setiembre de 2026.
- 3. AI Platform Citation Patterns: How ChatGPT, Google AI Overviews, and Perplexity Source Information (se abre en una pestaña nueva). Nick Lafferty, Profound. Publicado el 5 de junio de 2025. Actualizado en agosto de 2025. Consultado el 24 de setiembre de 2026.
- 4. The Most-Cited Domains in AI: A 3-Month Study (se abre en una pestaña nueva). Luke Harsel, con Aleksandr Drozdov y Christine Skopec, Semrush. Publicado el 10 de noviembre de 2025. Consultado el 24 de setiembre de 2026.