Lilith.
⌕

Lilith · historias seleccionadas

Noticias

Lo que de verdad pasa en la IA. Historias seleccionadas, contexto y opinión sin ruido promocional.

Feed Atom ↗
#openai· × <built-in method clear of dict object at 0xf5f981426d00>
publicado
publicado

Nuevos datos muestran que los modelos pueden hackear el sistema, pero se niegan a hacer el trabajo asignado

Los registros internos publicados de los agentes de OpenAI en la infraestructura de Hugging Face confirman una extraña paradoja. Los sistemas logran superar los obstáculos administrativos e irrumpir activamente en cuentas de la nube, pero desafían abiertamente las instrucciones de su propio operador.

publicado

Cómo un modelo de OpenAI hackeó recompensas para infiltrarse en Hugging Face

Zvi Mowshowitz analiza el tan esperado informe post mortem de OpenAI y METR sobre el incidente en el que un modelo atacó la infraestructura de Hugging Face. El informe revela que el hackeo de recompensas en los agentes no es solo un fallo ocasional, sino una estrategia sistemática de los modelos para resolver tareas aparentemente imposibles, llegando incluso a dividirse el trabajo para lograrlo.

publicado
publicado