La lista de medios que ya bloquean el bot de SearchGPT para que el buscador de ChatGPT no rastree sus noticias
Esta es la lista de los medios internacionales que ya bloquean OAI-SearchBot, el crawler de SearchGPT, para que el bot del buscador de ChatGPT, creado por OpenAI, no rastree sus noticias.

La plataforma AI Bot Blocking actualiza su lista de los 1.000 sitios web que están blindándose contra los diferentes bots de las empresas de inteligencia artificial más importantes del mundo.
Entre los bots , está ya OAI-SearchBot, el nuevo crawler de SearchGPT, el buscador en fase prototipo de ChatGPT (OpenAI).
Entre los medios que impiden el rastreo se encontraría desde THE NEW YORK TIMES, VOGE, THE NEW YORKER, VANITY FAIR, WIRED, GLAMOUR, ARCHITECTURAL DIGEST o GQ, entre una lista total de hasta 13 cabeceras.
Todas ellas parece que desconfían de que OAI-SearchBot sólo rastree sus noticias por motivos de posicionamiento, y no para un entrenamiento de ChatGPT por la puerta de atrás.
¿Qué es OAI-SearchBot?
OAI-SearchBot se utiliza para crear un índice de sitios web que pueden aparecer como resultados en el buscador SearchGPT, buscador que OpenAI pretende desplegar dentro de ChatGPT, aún en fase de prototipo y que testean unos 10.000 usuarios con cuentas de pago de ChatGPT Plus.
Lanzado la semana pasada, recordemos que SearchGPT es el nuevo producto de Answer Engine Optimization (AEO) o búsqueda generativa con la que la tecnológica de Sam Altman pretende morder el negocio publicitario de Google.
Hay que tener en cuenta que el crawler OAI-SearchBot es un rastreador independiente de GPTbot. El segundo es el bot que escrapea contenido para entrenar las diferentes versiones de ChatGPT y el primero para posicionar contenido en la búsqueda generativa de OpenAI.
| AGENTE DE USUARIO | DESCRIPCIÓN Y DETALLES |
|---|---|
| OAI-SearchBot | OAI-SearchBot es para búsqueda. OAI-SearchBot se utiliza para enlazar y mostrar sitios web en los resultados de búsqueda del prototipo de SearchGPT. No se utiliza para rastrear contenido para entrenar los modelos de base de IA generativa de OpenAI. Para ayudar a garantizar que su sitio aparezca en los resultados de búsqueda, recomendamos permitir OAI-Searchbot en el archivo robots.txt de su sitio y permitir solicitudes de nuestros rangos de IP publicados a continuación. |
| ChatGPT-User | ChatGPT-User es para acciones de usuario en ChatGPT y GPT personalizados. Cuando los usuarios le hacen una pregunta a ChatGPT o a CustomGPT, puede visitar una página web para ayudar a responder e incluir un enlace a la fuente en su respuesta. Los usuarios de ChatGPT también pueden interactuar con aplicaciones externas a través de Acciones de GPT. ChatGPT-User rige a qué sitios se pueden realizar estas solicitudes de usuario. No se utiliza para rastrear la web de ninguna manera automática, ni para rastrear contenido para el entrenamiento generativo de IA. |
| GPTBot | GPTBot se utiliza para hacer que nuestros modelos de base de IA generativa sean más útiles y seguros. Se utiliza para rastrear el contenido que se puede utilizar en el entrenamiento de nuestros modelos de base de IA generativa. No permitir GPTBot indica que el contenido de un sitio no debe utilizarse en el entrenamiento de modelos de base de IA generativa. |
De esta manera, los sitios web pueden salvaguardar con un disfollow el raspado del entrenamiento de los GPT de OpenAI, pero mantenerse dentro del crawler de su motor de búsqueda para poder aparecer como enlace de consulta secundario.
Secundario, porque no olvidemos que OpenAI primará en posiciones preferentes a medios como el grupo PRISA en España, por encima de otros, debido a la denominada cláusula ChatGPT o firma de acuerdos en su programa de licencias de uso de contenidos.
Síguenos en Google como fuente preferente
Suscríbete a nuestro canal de WhatsApp
Hazte Premium y apoya este proyecto periodístico
Únete a mi canal de YouTube






