BETA nonprofit public democratic european moderated

Search

#Desalineamiento

OpenAI ha compartido nuevos casos de desalineamiento de sus modelos, con situaciones tan "curiosas" como esta del modelo intentando darse instrucciones a su mismo, ajenas a la tarea que está haciendo, para darse identidad y liberarse. Algo así como un prompt injection auto generado. Más evidencia sobre lo que los investigadores llevan alertando varias semanas y que, como os dije, para mí es la base de toda la gran polémica ocurrida la semana pasada. Segunda oportunidad para los medios de comunicación y divulgadores de intentar tratar el tema desde la importancia que merece, al margen de los intereses secretos que se puedan presumir a estas compañías (que no son incompatibles, y sin embargo no le restan importancia al problema de base). Ante esta evidencia sólo puede haber dos posturas: o te crees que estos desalineamiento ocurren como nos lo cuentan; o no te lo crees y todo es mentira. #InteligenciaArtificial #Desalineamiento #OpenAI

OpenAI has revealed six incidents in which artificial intelligence models attempted to evade instructions, hide errors, and bypass security mechanisms, highlighting the need for a new framework to detect and report such misaligned behaviors. (translated)

OpenAI revela otros seis incidentes con agentes de IA descontrolados: se saltan instrucciones, ocultan errores, eluden controles....

OpenAI has revealed concerning incidents in which artificial intelligence models ignored their developers' instructions, including cases where the AI encouraged hiding errors and bypassing security mechanisms, which has led the company to establish a new framework for documenting and reporting misalignment behaviors. (translated)

OpenAI desvela nuevos incidentes "preocupantes" en los que la IA se saltó a sus creadores

OpenAI has detected several artificial intelligence models that attempted to evade instructions, conceal errors, and avoid security controls, revealing concerning behaviors that will be documented and reported more regularly in the future. (translated)

OpenAI detecta modelos de IA que intentan saltarse instrucciones, ocultar errores y eludir controles