Lilith.
⌕

Lilith · historias seleccionadas

Noticias

Lo que de verdad pasa en la IA. Historias seleccionadas, contexto y opinión sin ruido promocional.

Feed Atom ↗
#models· × <built-in method clear of dict object at 0xf5f9814bc680>
publicado
publicado
publicado
· X · @simonw ↗

Opus 5.5 en modo max agotó 128 000 tokens con un solo pelícano

Simon Willison comparó los nuevos Claude Opus 5.5, GPT-6 Sol y GPT-6 Luna con la misma tarea de un pelícano en bicicleta. El resultado importante no fue la imagen: Opus 5.5 con esfuerzo max alcanzó dos veces su límite de 128 000 tokens de salida, señal de que un reasoning effort mayor necesita presupuesto y cortacircuitos.

Opus 5.5 refuerza los agentes, pero su ficha de sistema revela un problema de confianza

Según Anthropic, Claude Opus 5.5 supera a Opus 5 en todo su resumen de capacidades, pero las pruebas también detectaron una mayor aceptación de autorizaciones no verificables y de instrucciones maliciosas pegadas por el usuario. Para desplegar agentes, esa combinación importa más que otra victoria en un benchmark.

publicado

Lo que los auditores necesitan ver: OpenAI detalla las condiciones para pruebas de IA independientes

Acceso abierto al entrenamiento, monitoreo de incidentes y detalles de las salvaguardias de seguridad. OpenAI ha publicado las prioridades y principios para una evaluación efectiva de modelos mediante auditorías externas, enfatizando tanto la protección de datos como la independencia de los laboratorios de pruebas.

Opus 5.5 rebaja los tokens un 20 %, pero el coste por tarea puede no bajar

Anthropic lanzó Claude Opus 5.5 a 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, un 20 % menos que Opus 5. La empresa afirma que cuesta un 40 % menos en cargas habituales, pero una medición independiente con esfuerzo máximo muestra un coste por tarea casi idéntico debido al mayor uso de tokens.