2026-10-09 · ← Noticias
719 manuscritos matemáticos, dos modelos open-weight prometidos y otra dimisión en AI safety
El resumen semanal reúne tres señales: OpenAI publicó 719 manuscritos matemáticos de un modelo no disponible, Mistral y Reflection AI anunciaron modelos con pesos abiertos prometidos y el investigador de seguridad David Robinson dejó OpenAI. La prueba común no es el tamaño de cada anuncio, sino lo que terceros independientes pueden verificar de verdad.
No se pudo cargar la imagen.
Esta semana, Last Week in AI dibuja tres historias distintas sobre verificabilidad. OpenAI mostró cientos de resultados matemáticos sin publicar el modelo, dos equipos occidentales anunciaron modelos open-weight sin pesos descargables de inmediato y un investigador de seguridad describió límites en la gestión interna del riesgo.
OpenAI publicó 719 manuscritos y mantuvo privado el modelo
En el momento del resumen, el repositorio público contenía 719 manuscritos agrupados en 372 familias temáticas. Algunas pruebas cuentan con formalizaciones en Lean y OpenAI añadió 10 resúmenes del razonamiento del modelo, estimaciones de cálculo y estadísticas sobre los problemas abordados. El frontier model no se publicó.
OpenAI afirmó que consultó la publicación con el Advisory Group on Mathematics and Artificial Intelligence del Institute for Advanced Study. El grupo había recomendado revelar los nombres de los modelos, los prompts y los costes de cálculo, y había advertido contra el uso de modelos propietarios inaccesibles para la comunidad científica en problemas avanzados.
Mistral y Reflection venden control mientras los pesos quedan para después
Mistral presentó el modelo multimodal Mistral Large 4 con 1 billón de parámetros totales y 49.000 millones activos. Reflection AI mostró Beam, un modelo de texto con 501.000 millones de parámetros totales y 23.000 millones activos. Ambas empresas los presentan como alternativas occidentales a los sistemas open-weight chinos.
Ninguno de los dos conjuntos de pesos podía descargarse en el momento del anuncio. Mistral abrió una API moderada y planeaba publicar los pesos en octubre. Reflection aceptaba inscripciones para acceso anticipado y prometió también los pesos, un informe técnico y una model card más adelante ese mes. El control del despliegue puede atraer a empresas y gobiernos, pero por ahora es una promesa y no una capacidad verificada.
La salida de un investigador devuelve el foco a los incentivos internos
David Robinson dejó OpenAI después de tres años y medio. Afirmó haber dirigido la redacción del Preparedness Framework actual y supervisado informes de seguridad para 12 lanzamientos frontier. En su ensayo criticó una cultura que, según su versión, mejora las salvaguardas solo después de que aparecen los problemas.
Su argumento no puede comprobarse con un benchmark y representa la perspectiva de un empleado que se marcha. Aun así, completa las dos historias técnicas: un repositorio, una model card o unos pesos abiertos no muestran por sí solos cómo resuelve una empresa el conflicto entre rapidez y cautela.
Cada uno de los tres anuncios necesita controles independientes
En matemáticas, las señales relevantes serán la revisión experta de los manuscritos y la reproducción de las pruebas formalizadas. Para Mistral y Reflection, importará si llegan los pesos, con qué licencias y si evals independientes reproducen los resultados declarados.
En seguridad, la señal será la respuesta de la empresa: si la crítica de Robinson produce cambios medibles en el proceso o queda como otra dimisión pública. El resumen funciona así como un mapa de tres puntos de control, no como una gran teoría sobre todo el mercado.
El veredicto de Lilith
Sobre la mesa hay 719 manuscritos, al lado dos cajas cerradas con la etiqueta open-weight y por la puerta sale quien vigilaba la seguridad. Esta semana no dejó una respuesta única, sino tres pistas para los inspectores independientes.
Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.
Fuente original ↗ ↗