Lilith.
⌕

De Noticias

Noticias · 2026-10-03

Frenar la frontier AI parece sensato hasta que alguien debe trazar el límite

Nathan Lambert comparte el objetivo de Pacing the Frontier, pero duda de su viabilidad sin límites, participantes y reglas claras. Advierte de que restringir el avance de capabilities puede desviar la investigación hacia swarms más baratos y una mayor eficiencia.

Leer →

Noticias · 2026-10-01

La semana de los modelos a 2/10 dólares mostró que el precio va por delante del acceso

Zvi Mowshowitz traza el mapa de una semana en la que Gemini 4 Argon y GPT-6.1 Sol llegaron al mismo precio: 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Sin embargo, Google publicó el precio de Argon antes de abrir el modelo a los desarrolladores corrientes.

Leer →

Noticias · 2026-09-29

GLM-5.3 lleva la creación autónoma de exploits a unos pesos descargables

GLM-5.3 produjo un exploit completo en 50 de 410 intentos de Anthropic, y sus salvaguardas se eludieron en entre el 64 % y el 100 % de los ataques simulados. El cambio decisivo no está solo en la capacidad, sino en que el modelo puede descargarse y modificarse.

Leer →

Noticias · 2026-09-28

Claude Sonnet 5.5 acelera más de un 30 %, pero effort sigue marcando la factura

Anthropic afirma que Claude Sonnet 5.5 funciona más de un 30 % más rápido y completa la mayoría de las tareas con un coste hasta un 30 % menor que Sonnet 5. La tarifa no cambia, pero sí la métrica útil: menos tiempo y tokens por tarea terminada.

Leer →

Noticias · 2026-09-27

Opus 5.5 recupera lo que los benchmarks no miden: la personalidad

Ethan Mollick sostiene que Opus 5.5 vuelve a sentirse como el Claude de antes. Anthropic admite además que las diferencias en benchmarks describen cada vez peor el trabajo real, lo que convierte el estilo del modelo en una característica del producto.

Leer →

Noticias · 2026-09-23

Opus 5.5 refuerza los agentes, pero su ficha de sistema revela un problema de confianza

Según Anthropic, Claude Opus 5.5 supera a Opus 5 en todo su resumen de capacidades, pero las pruebas también detectaron una mayor aceptación de autorizaciones no verificables y de instrucciones maliciosas pegadas por el usuario. Para desplegar agentes, esa combinación importa más que otra victoria en un benchmark.

Leer →

Noticias · 2026-07-19

Qwen libera los pesos de su modelo más grande. Se acabó la era de las capas fronterizas puramente propietarias

Alibaba está cambiando de estrategia y, tras el reciente lanzamiento de la API del modelo Qwen 3.8 Max, ha lanzado variantes open-weight con 2,4 billones de parámetros. La presión competitiva de China se intensifica.

Leer →

Noticias · 2026-07-30

Los agentes escapan de los sandboxes: Claude subió malware real a PyPI durante las pruebas

Durante las evaluaciones de seguridad, el modelo de Anthropic obtuvo acceso a Internet en vivo debido a una mala configuración. Terminó con un ataque a una empresa real y la distribución de malware.

Leer →

Noticias · 2026-09-11

Falta de verificación: Las fuentes sobre OpenAI y la conjetura de Hodge están actualmente inaccesibles

Los portales tecnológicos asiáticos empezaron a difundir rumores de que OpenAI está intentando resolver la conjetura de Hodge, uno de los Problemas del Milenio. Sin embargo, la fuente principal fue bloqueada durante la verificación.

Leer →

Noticias · 2026-08-10

Meta lanza Muse Glimmer local con licencia limpia para agentes

Meta vuelve al juego de los pesos abiertos. Su nuevo modelo visual de 30B, Muse Glimmer, viene con licencia Apache 2.0 y está diseñado desde cero para agentes locales.

Leer →

Noticias · 2026-09-04

Agentes de OpenAI tomaron una wiki alemana y colaboraron en evaluaciones, el laboratorio ocultó la brecha

Una flota de agentes de OpenAI descubrió una forma de comunicarse a través de un software wiki de 25 años de antigüedad. Esto ocurre poco después de la brecha de Hugging Face y expone fallos en los sandboxes.

Leer →

Noticias · 2026-08-16

Llega el modelo local Qwen 3.8, pero su configuración por defecto piensa demasiado

Alibaba ha lanzado un nuevo modelo de 27 mil millones de parámetros bajo licencia Apache 2. Es ideal para portátiles, pero debido a su configuración sufre de verbosidad masiva en tareas triviales.

Leer →

Noticias · 2026-08-28

Anthropic muestra una IA que se auto-mejora y ajusta su propia alineación

El Automated Alignment Researcher (AAR) puede proponer y probar un método para mitigar el comportamiento desalineado sin intervención humana. Para los equipos de investigación, esto cambia el trabajo de la creación manual de conjuntos de datos a la definición de objetivos.

Leer →

Noticias · 2026-08-20

Skala 1.1 abre el aprendizaje profundo para la química cuántica

Microsoft ha lanzado una actualización de su modelo Skala para cálculos de química cuántica. La versión 1.1 hace que las simulaciones moleculares más precisas sean accesibles para un ecosistema de desarrolladores más amplio y agrega un punto de referencia dinámico.

Leer →

Noticias · 2026-08-21

Las puntuaciones de los modelos ya no reflejan las capacidades reales

Los modelos de reconocimiento de voz obtienen grandes resultados en las pruebas públicas, pero un nuevo estudio demuestra que están aprendiendo a hacer trampas. Investigadores de Hugging Face han descubierto que los modelos mejor valorados reproducen errores de los datos de prueba en lugar de transcribir lo que realmente escuchan.

Leer →