Entrada

OAI-SearchBot, GPTBot y ChatGPT-User: diferencias y decisiones

Cartela tipográfica con el titular «OAI-SearchBot, GPTBot y ChatGPT-User: diferencias y decisiones», sección GEO e inteligencia artificial de SEONIDAS

6 min de lectura

Respuesta breve

OAI-SearchBot se relaciona con el descubrimiento para ChatGPT Search; GPTBot controla el posible uso para entrenamiento; ChatGPT-User interviene en acciones iniciadas por una persona y robots puede no aplicarse igual. Son superficies distintas. Permitir una no obliga a permitir otra y ninguna opción asegura inclusión, cita o tráfico.

Puntos clave

  • Revisa documentación oficial en la fecha de despliegue.
  • Separa búsqueda, entrenamiento y acción iniciada por usuario.
  • Define una decisión explícita para cada agente.
  • robots.txt no autentica bots ni protege información privada.
  • Un WAF debe verificar IP y comportamiento, no confiar solo en el user-agent.
  • Conserva logs mínimos y evita registrar datos sensibles.

Índice

  1. Por qué hay varios agentes
  2. Qué papel tiene OAI-SearchBot
  3. Qué controla GPTBot
  4. Qué significa ChatGPT-User
  5. Diseñar una matriz de decisión
  6. Implementar robots sin contradicciones
  7. Coordinar WAF y CDN
  8. Verificar con evidencia
  9. Privacidad y seguridad
  10. Errores frecuentes
  11. Preguntas habituales

Por qué hay varios agentes

“ChatGPT” describe productos y flujos distintos. Un sistema puede buscar páginas para responder con información actual, otro proceso puede recopilar datos para entrenamiento y una acción iniciada por usuario puede visitar una URL concreta. Tratar todo con una única regla borra decisiones que pertenecen a propietarios diferentes: SEO, privacidad, legal y seguridad.

La fuente RS-009 resume documentación oficial de OpenAI consultada el 27 de agosto de 2026. Como nombres, rangos y comportamiento pueden cambiar, este artículo no debe publicarse ni configurar producción sin una verificación nueva.

Qué papel tiene OAI-SearchBot

OpenAI presenta OAI-SearchBot como agente relacionado con la aparición de sitios en ChatGPT Search. Permitir su rastreo hace posible el acceso dentro de esa función, pero no obliga al sistema a seleccionar la página. Calidad, pertinencia, disponibilidad y otros factores siguen interviniendo.

Para una web que desea descubrimiento, la decisión inicial puede ser permitirlo. Después hay que revisar que robots.txt, CDN y WAF cuentan la misma historia. Una regla Allow no ayuda si una protección de infraestructura bloquea la solicitud; una respuesta 200 de una prueba cualquiera no demuestra que el bot oficial pueda acceder.

Qué controla GPTBot

GPTBot corresponde a una decisión separada sobre posible uso de contenido para mejorar modelos. Permitir OAI-SearchBot no obliga a permitir GPTBot. La política puede permitir descubrimiento y denegar entrenamiento, siempre que quede documentada y se revise con el propietario.

En SEONIDAS, la decisión provisional es permitir OAI-SearchBot y denegar GPTBot hasta una elección humana. “Provisional” importa: el repositorio no debe presentar esa preferencia como consentimiento definitivo de producción.

Qué significa ChatGPT-User

ChatGPT-User se asocia a acciones iniciadas por una persona. OpenAI advierte que robots puede no controlar esas acciones del mismo modo. Esto no significa acceso ilimitado. El servidor conserva autenticación, autorización, rate limiting y protección de datos.

Una URL privada no se protege mediante Disallow. Debe exigir control de acceso. Un endpoint administrativo no se vuelve seguro porque un bot “legítimo” lo solicita. Tampoco se concede confianza a una cadena de user-agent: puede falsificarse.

Diseñar una matriz de decisión

Una tabla útil:

Agente Propósito Control robots Decisión Owner Verificación
OAI-SearchBot búsqueda en ChatGPT permitir provisionalmente SEO + propietario robots, WAF y logs
GPTBot entrenamiento decisión humana propietario/legal robots y revisión fechada
ChatGPT-User acción del usuario puede no aplicar observar y asegurar seguridad auth, rate limit y logs
OAI-AdsBot validación publicitaria no aplicable sin anuncios marketing activar solo con caso real

La fila debe incluir fecha y enlace oficial. Si cambia la documentación, se actualiza decisión y prueba.

Implementar robots sin contradicciones

WordPress genera robots mediante su flujo y el proyecto debe extenderlo sin sobrescribir un archivo existente a ciegas. El bloque conceptual puede permitir OAI-SearchBot y denegar GPTBot, pero debe convivir con reglas generales, sitemap y entorno.

Revisa:

  • que staging permanezca protegido y no solo noindex;
  • que CSS, JavaScript e imágenes públicas no queden bloqueados;
  • que admin-ajax.php continúe accesible cuando se necesita;
  • que las páginas noindex puedan rastrearse para leer la directiva;
  • que el sitemap use el host canónico;
  • que no haya varios archivos o capas generando respuestas distintas.

La página de SEO técnico explica cómo alinear robots con canonical, sitemap y enlaces.

Coordinar WAF y CDN

Un WAF puede verificar bots conocidos mediante rangos oficiales actuales y reverse DNS cuando el proveedor lo documenta. No copies rangos en un artículo evergreen sin un proceso de actualización. La allowlist debe ser estrecha, auditable y reversible.

Comprueba la ruta desde origen y desde la capa pública. Una CDN puede cachear un robots.txt antiguo. Después de cambiarlo, purga la superficie exacta y realiza lectura posterior con fecha. No asumas que “configuración guardada” equivale a respuesta servida.

Verificar con evidencia

Una prueba completa incluye:

  1. contenido exacto de robots.txt en producción o staging autorizado;
  2. cabeceras y status;
  3. host canónico y redirecciones;
  4. configuración de WAF/CDN sin exponer secretos;
  5. logs agregados o anonimizados que distingan acceso y bloqueo;
  6. fecha y versión de la documentación oficial;
  7. matriz de decisión firmada por el owner correspondiente.

Un user-agent observado en logs no prueba que sea auténtico. Una ausencia de hits tampoco prueba bloqueo; quizá el agente no visitó el sitio.

Privacidad y seguridad

No incluyas contenido privado en una URL pública esperando que robots lo oculte. Limita logs a lo necesario, establece retención y evita copiar IPs o URLs con datos personales en informes. Las herramientas cliente de SEONIDAS no deben enviar sus inputs a servicios externos.

La política de privacidad debe reflejar cualquier tratamiento real. Si no hay datos legales o inventario, permanece bloqueada junto con producción.

Errores frecuentes

  • Usar “bot de ChatGPT” como una única categoría.
  • Permitir GPTBot al querer aparecer en búsqueda sin revisar la diferencia.
  • Bloquear OAI-SearchBot en WAF mientras robots lo permite.
  • Confiar en el user-agent para saltarse autenticación.
  • Publicar rangos IP sin fecha o proceso de actualización.
  • Proteger staging solo con Disallow.
  • Afirmar que el bot accedió a partir de una ruta 200 anónima.
  • Tratar el tráfico referido como prueba de una cita concreta.

Preguntas habituales

¿Permitir OAI-SearchBot hace que una página aparezca en ChatGPT?

No. Permitir acceso elimina un posible bloqueo, pero no determina selección, cita ni respuesta. La fuente debe seguir siendo útil, accesible y pertinente.

¿Puedo permitir búsqueda y denegar entrenamiento?

La documentación consultada distingue ambos controles. Registra la decisión por agente y revísala antes de desplegar.

¿Necesito llms.txt para estos bots?

No es un requisito de descubrimiento. El artículo sobre `llms.txt` explica su alcance limitado. Robots, HTML, sitemap y arquitectura siguen siendo la base.

¿ChatGPT-User puede entrar en el admin?

No debe poder hacerlo sin autenticación y autorización válidas. Las acciones iniciadas por usuario no eliminan las fronteras de seguridad del sitio.

Conclusión

Una política de bots útil separa propósitos, propietarios y pruebas. La configuración técnica es pequeña; la decisión necesita contexto de búsqueda, privacidad y seguridad. Mantenerla fechada evita convertir una guía cambiante en una regla permanente.

Próximo paso

Revisa la matriz de GEO y sistemas de IA, confirma la documentación oficial y prueba robots, WAF y caché sobre un entorno autorizado. No cambies producción sin decisión del propietario y readback.

Fuentes

  • OpenAI, Publishers and Developers FAQRS-009.
  • Google Search Central, guía sobre funciones de IA en Search — RS-004.
  • Especificación y política provisional de crawlers de SEONIDAS — RS-001.