6 min de lectura
Respuesta breve
OAI-SearchBot se relaciona con el descubrimiento para ChatGPT Search; GPTBot controla el posible uso para entrenamiento; ChatGPT-User interviene en acciones iniciadas por una persona y robots puede no aplicarse igual. Son superficies distintas. Permitir una no obliga a permitir otra y ninguna opción asegura inclusión, cita o tráfico.
Puntos clave
- Revisa documentación oficial en la fecha de despliegue.
- Separa búsqueda, entrenamiento y acción iniciada por usuario.
- Define una decisión explícita para cada agente.
robots.txtno autentica bots ni protege información privada.- Un WAF debe verificar IP y comportamiento, no confiar solo en el user-agent.
- Conserva logs mínimos y evita registrar datos sensibles.
Índice
- Por qué hay varios agentes
- Qué papel tiene OAI-SearchBot
- Qué controla GPTBot
- Qué significa ChatGPT-User
- Diseñar una matriz de decisión
- Implementar robots sin contradicciones
- Coordinar WAF y CDN
- Verificar con evidencia
- Privacidad y seguridad
- Errores frecuentes
- Preguntas habituales
Por qué hay varios agentes
“ChatGPT” describe productos y flujos distintos. Un sistema puede buscar páginas para responder con información actual, otro proceso puede recopilar datos para entrenamiento y una acción iniciada por usuario puede visitar una URL concreta. Tratar todo con una única regla borra decisiones que pertenecen a propietarios diferentes: SEO, privacidad, legal y seguridad.
La fuente RS-009 resume documentación oficial de OpenAI consultada el 27 de agosto de 2026. Como nombres, rangos y comportamiento pueden cambiar, este artículo no debe publicarse ni configurar producción sin una verificación nueva.
Qué papel tiene OAI-SearchBot
OpenAI presenta OAI-SearchBot como agente relacionado con la aparición de sitios en ChatGPT Search. Permitir su rastreo hace posible el acceso dentro de esa función, pero no obliga al sistema a seleccionar la página. Calidad, pertinencia, disponibilidad y otros factores siguen interviniendo.
Para una web que desea descubrimiento, la decisión inicial puede ser permitirlo. Después hay que revisar que robots.txt, CDN y WAF cuentan la misma historia. Una regla Allow no ayuda si una protección de infraestructura bloquea la solicitud; una respuesta 200 de una prueba cualquiera no demuestra que el bot oficial pueda acceder.
Qué controla GPTBot
GPTBot corresponde a una decisión separada sobre posible uso de contenido para mejorar modelos. Permitir OAI-SearchBot no obliga a permitir GPTBot. La política puede permitir descubrimiento y denegar entrenamiento, siempre que quede documentada y se revise con el propietario.
En SEONIDAS, la decisión provisional es permitir OAI-SearchBot y denegar GPTBot hasta una elección humana. “Provisional” importa: el repositorio no debe presentar esa preferencia como consentimiento definitivo de producción.
Qué significa ChatGPT-User
ChatGPT-User se asocia a acciones iniciadas por una persona. OpenAI advierte que robots puede no controlar esas acciones del mismo modo. Esto no significa acceso ilimitado. El servidor conserva autenticación, autorización, rate limiting y protección de datos.
Una URL privada no se protege mediante Disallow. Debe exigir control de acceso. Un endpoint administrativo no se vuelve seguro porque un bot “legítimo” lo solicita. Tampoco se concede confianza a una cadena de user-agent: puede falsificarse.
Diseñar una matriz de decisión
Una tabla útil:
| Agente | Propósito | Control robots | Decisión | Owner | Verificación |
|---|---|---|---|---|---|
| OAI-SearchBot | búsqueda en ChatGPT | sí | permitir provisionalmente | SEO + propietario | robots, WAF y logs |
| GPTBot | entrenamiento | sí | decisión humana | propietario/legal | robots y revisión fechada |
| ChatGPT-User | acción del usuario | puede no aplicar | observar y asegurar | seguridad | auth, rate limit y logs |
| OAI-AdsBot | validación publicitaria | sí | no aplicable sin anuncios | marketing | activar solo con caso real |
La fila debe incluir fecha y enlace oficial. Si cambia la documentación, se actualiza decisión y prueba.
Implementar robots sin contradicciones
WordPress genera robots mediante su flujo y el proyecto debe extenderlo sin sobrescribir un archivo existente a ciegas. El bloque conceptual puede permitir OAI-SearchBot y denegar GPTBot, pero debe convivir con reglas generales, sitemap y entorno.
Revisa:
- que staging permanezca protegido y no solo
noindex; - que CSS, JavaScript e imágenes públicas no queden bloqueados;
- que
admin-ajax.phpcontinúe accesible cuando se necesita; - que las páginas
noindexpuedan rastrearse para leer la directiva; - que el sitemap use el host canónico;
- que no haya varios archivos o capas generando respuestas distintas.
La página de SEO técnico explica cómo alinear robots con canonical, sitemap y enlaces.
Coordinar WAF y CDN
Un WAF puede verificar bots conocidos mediante rangos oficiales actuales y reverse DNS cuando el proveedor lo documenta. No copies rangos en un artículo evergreen sin un proceso de actualización. La allowlist debe ser estrecha, auditable y reversible.
Comprueba la ruta desde origen y desde la capa pública. Una CDN puede cachear un robots.txt antiguo. Después de cambiarlo, purga la superficie exacta y realiza lectura posterior con fecha. No asumas que “configuración guardada” equivale a respuesta servida.
Verificar con evidencia
Una prueba completa incluye:
- contenido exacto de
robots.txten producción o staging autorizado; - cabeceras y status;
- host canónico y redirecciones;
- configuración de WAF/CDN sin exponer secretos;
- logs agregados o anonimizados que distingan acceso y bloqueo;
- fecha y versión de la documentación oficial;
- matriz de decisión firmada por el owner correspondiente.
Un user-agent observado en logs no prueba que sea auténtico. Una ausencia de hits tampoco prueba bloqueo; quizá el agente no visitó el sitio.
Privacidad y seguridad
No incluyas contenido privado en una URL pública esperando que robots lo oculte. Limita logs a lo necesario, establece retención y evita copiar IPs o URLs con datos personales en informes. Las herramientas cliente de SEONIDAS no deben enviar sus inputs a servicios externos.
La política de privacidad debe reflejar cualquier tratamiento real. Si no hay datos legales o inventario, permanece bloqueada junto con producción.
Errores frecuentes
- Usar “bot de ChatGPT” como una única categoría.
- Permitir GPTBot al querer aparecer en búsqueda sin revisar la diferencia.
- Bloquear OAI-SearchBot en WAF mientras robots lo permite.
- Confiar en el user-agent para saltarse autenticación.
- Publicar rangos IP sin fecha o proceso de actualización.
- Proteger staging solo con
Disallow. - Afirmar que el bot accedió a partir de una ruta 200 anónima.
- Tratar el tráfico referido como prueba de una cita concreta.
Preguntas habituales
¿Permitir OAI-SearchBot hace que una página aparezca en ChatGPT?
No. Permitir acceso elimina un posible bloqueo, pero no determina selección, cita ni respuesta. La fuente debe seguir siendo útil, accesible y pertinente.
¿Puedo permitir búsqueda y denegar entrenamiento?
La documentación consultada distingue ambos controles. Registra la decisión por agente y revísala antes de desplegar.
¿Necesito llms.txt para estos bots?
No es un requisito de descubrimiento. El artículo sobre `llms.txt` explica su alcance limitado. Robots, HTML, sitemap y arquitectura siguen siendo la base.
¿ChatGPT-User puede entrar en el admin?
No debe poder hacerlo sin autenticación y autorización válidas. Las acciones iniciadas por usuario no eliminan las fronteras de seguridad del sitio.
Conclusión
Una política de bots útil separa propósitos, propietarios y pruebas. La configuración técnica es pequeña; la decisión necesita contexto de búsqueda, privacidad y seguridad. Mantenerla fechada evita convertir una guía cambiante en una regla permanente.
Próximo paso
Revisa la matriz de GEO y sistemas de IA, confirma la documentación oficial y prueba robots, WAF y caché sobre un entorno autorizado. No cambies producción sin decisión del propietario y readback.
