Openai refuerza seguridad de sus modelos con programa de recompensas por hallazgos de vulnerabilidades en ia

En un movimiento innovador para la seguridad en inteligencia artificial, OpenAI ha lanzado un programa llamado Safety Bug Bounty que recompensa a investigadores y expertos por descubrir fallos en el comportamiento de sus modelos. Esta iniciativa se centra en riesgos emergentes como la manipulación mediante prompts o el abuso de agentes autónomos.

Objetivo: detectar problemas en escenarios reales

Objetivo: detectar problemas en escenarios reales

El objetivo principal es encontrar problemas que puedan surgir en situaciones reales, como la inyección de instrucciones maliciosas, la filtración de datos o acciones dañinas ejecutadas por sistemas automatizados. Esto llega en un momento clave, después de la incorporación de nuevas funciones dentro del ecosistema de ChatGPT, como bibliotecas de contenido y herramientas de compra integradas.

Para que una vulnerabilidad sea válida, los investigadores deben demostrar que el fallo puede reproducirse de manera consistente, aproximadamente en la mitad de los intentos. Además, OpenAI acepta informes relacionados con la exposición de información sensible, incluyendo el comportamiento interno de los modelos o sus patrones de razonamiento.

No obstante, no todo tipo de hallazgo es elegible. La compañía excluye los llamados jailbreaks simples, los fallos de bajo impacto o aquellos que no presenten una solución clara o consecuencias prácticas. Las propuestas serán revisadas por equipos especializados en seguridad y comportamiento de IA, y algunas podrían redirigirse según su naturaleza.

OpenAI tampoco descarta lanzar en el futuro programas privados adicionales para investigar áreas especialmente sensibles.