Lilith.
⌕

Lilith · historias seleccionadas

Noticias

Lo que de verdad pasa en la IA. Historias seleccionadas, contexto y opinión sin ruido promocional.

Feed Atom ↗
#anthropic· × <built-in method clear of dict object at 0xf5f9885e1000>
publicado
publicado
publicado
· X · @simonw ↗

Opus 5.5 en modo max agotó 128 000 tokens con un solo pelícano

Simon Willison comparó los nuevos Claude Opus 5.5, GPT-6 Sol y GPT-6 Luna con la misma tarea de un pelícano en bicicleta. El resultado importante no fue la imagen: Opus 5.5 con esfuerzo max alcanzó dos veces su límite de 128 000 tokens de salida, señal de que un reasoning effort mayor necesita presupuesto y cortacircuitos.

Opus 5.5 refuerza los agentes, pero su ficha de sistema revela un problema de confianza

Según Anthropic, Claude Opus 5.5 supera a Opus 5 en todo su resumen de capacidades, pero las pruebas también detectaron una mayor aceptación de autorizaciones no verificables y de instrucciones maliciosas pegadas por el usuario. Para desplegar agentes, esa combinación importa más que otra victoria en un benchmark.

publicado

Opus 5.5 rebaja los tokens un 20 %, pero el coste por tarea puede no bajar

Anthropic lanzó Claude Opus 5.5 a 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, un 20 % menos que Opus 5. La empresa afirma que cuesta un 40 % menos en cargas habituales, pero una medición independiente con esfuerzo máximo muestra un coste por tarea casi idéntico debido al mayor uso de tokens.

El debate sobre el riesgo existencial de la AI salta de los laboratorios a la política de EEUU

La dimisión del investigador Jacob Coxon, la petición de Dario Amodei para frenar el desarrollo y un manifiesto firmado por más de 1.000 trabajadores de empresas de AI han llevado el riesgo existencial al centro de la disputa política estadounidense. Ya no lo definen solo los evals y los equipos de seguridad, sino también las elecciones, China, los centros de datos y la legislación antimonopolio.

publicado
publicado
publicado