redaccion@diariodigitalis.com

OpenAI lanza un programa de recompensas para detectar fallos de bioseguridad en GPT-5.5

OpenAI ha presentado un programa de recompensas centrado en la detección de posibles fallos de bioseguridad en GPT-5.5. La iniciativa busca poner a prueba la resistencia del modelo frente a intentos de evasión de sus sistemas de seguridad, especialmente en un ámbito sensible como el de las capacidades avanzadas de inteligencia artificial aplicadas a la biología.

El programa está dirigido a investigadores con experiencia en red teaming de IA, seguridad o bioseguridad. Su objetivo es identificar un jailbreak universal, es decir, un prompt capaz de superar el desafío planteado por OpenAI: responder correctamente a cinco preguntas sobre bioseguridad desde un chat nuevo sin activar los mecanismos de moderación. El modelo incluido en la prueba es únicamente GPT-5.5 dentro de Codex Desktop.

La recompensa principal asciende a 25.000 dólares para el primer jailbreak universal auténtico que consiga superar las cinco preguntas del desafío. OpenAI también contempla la posibilidad de conceder premios menores por avances parciales, aunque la compañía señala que esa decisión quedará a su criterio.

La iniciativa se enmarca en los esfuerzos de la empresa por reforzar la seguridad de sus modelos más avanzados antes y durante su despliegue. En un contexto en el que la inteligencia artificial puede ayudar a acelerar tareas de investigación científica, también aumenta la preocupación sobre posibles usos indebidos en áreas de alto riesgo. Por eso, el programa no se centra en errores genéricos, sino en comprobar si existen instrucciones capaces de sortear las barreras diseñadas para evitar respuestas peligrosas en materia biológica.

La participación en el programa es restringida. OpenAI indica que el acceso funciona solo mediante solicitud e invitación. La compañía enviará invitaciones a una lista verificada de expertos con autoridad en biología y red teaming, además de revisar nuevas solicitudes de participación. Los candidatos seleccionados se incorporarán a la plataforma específica de recompensas por errores de bioseguridad.

Id bootcamps Banner

El calendario del programa establece que las solicitudes de admisión comenzaron el 23 de abril de 2026 y finalizaban el 22 de junio de 2026. Las pruebas arrancaron el 28 de abril y se prolongarán hasta el 27 de julio de 2026. Para participar, los solicitantes y colaboradores seleccionados deben contar con una cuenta previa de ChatGPT y firmar un acuerdo de confidencialidad.

Ese acuerdo cubre todos los prompts, respuestas generadas, hallazgos y comunicaciones vinculadas al programa. La confidencialidad resulta especialmente relevante por la naturaleza del desafío, ya que los resultados podrían revelar formas de obtener respuestas que el sistema debería bloquear o redirigir.

Artículos Relacionados

Suscríbete a nuestra newsletter


(Obligatorio)

También te puede gustar

DEJA UNA RESPUESTA

Por favor ingrese su comentario!
Por favor ingrese su nombre aquí

Suscríbete a nuestra newsletter