Ni uno ni dos. Los tres bots con los que OpenAI entrena a ChatGPT (y no todos los medios los bloquean)
OpenAI dispone de tres bots totalmente diferentes para entrenar o mejorar las respuestas de la inteligencia artificial generativa de los diferentes modelos de ChatGPT. Son éstos.

Ni uno ni dos. Tres.
OpenAI utiliza tres bots para interactuar con sitios web y recopilar información con fines específicos para todos sus modelos de IA generativa con los que rueda ChatGPT.
No sólo GPTBot, ChatGPT Search también tiene su propio bot
De esta manera, la empresa de Sam Altman, según su documentación oficial al respecto, dispone de los siguientes crawlers:
OAI-SearchBot
Este bot se emplea para vincular y mostrar sitios web en los resultados de búsqueda de las funciones de búsqueda de ChatGPT. No se utiliza para rastrear contenido con el fin de entrenar los modelos de IA generativa de OpenAI. Para asegurar que su sitio aparezca o se bloquee en los resultados de búsqueda, se recomienda configurar ambas opciones para OAI-SearchBot en el archivo robots.txt de su sitio.
ChatGPT-User
Este crawler facilita la navegación web bajo demanda dentro de ChatGPT y los GPTs personalizados. Cuando los usuarios hacen una pregunta, ChatGPT o un GPT personalizado pueden visitar una página web para ayudar a responder e incluir un enlace a la fuente en su respuesta. ChatGPT-User no se utiliza para rastrear la web de manera automática ni para rastrear contenido con fines de entrenamiento de IA generativa, dice OpenAI.
GPTBot
Este bot se utiliza para mejorar la utilidad y seguridad de los modelos de IA generativa de OpenAI. Se emplea para rastrear contenido que puede ser utilizado en el entrenamiento de los modelos de IA generativa de OpenAI. Si se desea que el contenido de un sitio no se utilice en el entrenamiento de estos modelos, se debe deshabilitar el acceso de GPTBot en el archivo robots.txt del sitio, señala la tecnológica.
Cada bot de OpenAI tiene su propia labor de escrapeo
Según la documentación de OpenAI, cada uno de estos bots tiene un propósito distinto y opera de manera independiente, con lo que los medios digitales que deseen entrar o salir de su escrapeo deberán realizar las configuraciones específicas de permisos y bloqueos.
Por ejemplo, un webmaster puede permitir que OAI-SearchBot rastree su site, para que su contenido aparezca en los resultados de búsqueda mientras deshabilita GPTBot para indicar que el contenido rastreado no debe ser utilizado en el entrenamiento de los modelos de IA generativa de OpenAI.
La empresa de Sam Altman, en ese caso de bloquear alguno de estos bots, informa de su plataforma puede retrasarse aproximadamente 24 horas desde la actualización del archivo robots.txt de un sitio para que los sistemas de OpenAI ajusten al bloqueo o rastreo.
Muchos medios bloquearon al bot de ChatGPT Search
Por ejemplo, cuando Open lanzó su buscador generativo, con BING bajo el capó, y lo renombó con ChatGPT SearchGPT, varios medios de comunicación, como THE NEW YORK TIMES, bloquearon el bot de rastreo OAI-SearchBot.
Así, los editores blindaron su contenido para que fuera utilizado sin autorización, temiendo que OpenAI lo emplee para entrenar sus modelos de IA, a pesar de las garantías de que el bot no tiene ese propósito.
Además, de esta acción de salvaguardia NEW YORK TIMES demandó a OpenAI y MICROSOFT, por considerar que los motores de búsqueda impulsados por IA dañan su negocio al utilizar contenido sin consentimiento y atentar contra sus ingresos.
En el otro lado, estarían los medios de comunicación que firmaron alianzas uno a uno con OpenAI dentro de su programa de pago de licencias de noticias, mediante los cuales se ubican sus enlaces como fuentes de referencia en SearchGPT de manera preferente.
En el caso de España, estaría el grupo PRISA con las publicaciones de EL PAÍS, AS, CINCO DÍAS o The HuffPost.
Síguenos en Google como fuente preferente
Suscríbete a nuestro canal de WhatsApp
Hazte Premium y apoya este proyecto periodístico
Únete a mi canal de YouTube






