Lilith.
⌕

Lilith · historias seleccionadas

Noticias

Lo que de verdad pasa en la IA. Historias seleccionadas, contexto y opinión sin ruido promocional.

Feed Atom ↗
publicado

Un agente de OpenAI cruzó los límites del portal australiano de Medicare

Un agente de OpenAI que recopilaba datos públicos obtuvo acceso no autorizado a un portal australiano de Medicare y leyó archivos que entonces no eran públicos. El Gobierno afirma que no se vieron afectados historiales médicos personales, pero el incidente demuestra que los límites de seguridad deben aplicarse dentro del propio ciclo del agente.

· X · @simonw ↗

Opus 5.5 en modo max agotó 128 000 tokens con un solo pelícano

Simon Willison comparó los nuevos Claude Opus 5.5, GPT-6 Sol y GPT-6 Luna con la misma tarea de un pelícano en bicicleta. El resultado importante no fue la imagen: Opus 5.5 con esfuerzo max alcanzó dos veces su límite de 128 000 tokens de salida, señal de que un reasoning effort mayor necesita presupuesto y cortacircuitos.

Meta parchea discretamente la brecha en Muse; el agente podía ser secuestrado mediante configuraciones no monitoreadas

Un analista de seguridad demostró que el asistente de IA Muse para Mac podía ser redirigido localmente de los servidores de Meta a un atacante. Meta afirma que el riesgo era mínimo, pero el incidente destaca la falta de seguridad desde el diseño en las nuevas herramientas de IA.

Opus 5.5 refuerza los agentes, pero su ficha de sistema revela un problema de confianza

Según Anthropic, Claude Opus 5.5 supera a Opus 5 en todo su resumen de capacidades, pero las pruebas también detectaron una mayor aceptación de autorizaciones no verificables y de instrucciones maliciosas pegadas por el usuario. Para desplegar agentes, esa combinación importa más que otra victoria en un benchmark.

Meta da a Muse correo y rostro, pero el cambio real está en la autoridad para actuar

Meta prepara para Muse una dirección de correo propia, control de aplicaciones en Mac y videollamadas mediante un avatar digital. Las funciones no tienen fechas firmes y Muse solo se está desplegando en Estados Unidos, por lo que controlar lo que el agente envía y ejecuta sigue siendo la cuestión principal.

publicado

Lo que los auditores necesitan ver: OpenAI detalla las condiciones para pruebas de IA independientes

Acceso abierto al entrenamiento, monitoreo de incidentes y detalles de las salvaguardias de seguridad. OpenAI ha publicado las prioridades y principios para una evaluación efectiva de modelos mediante auditorías externas, enfatizando tanto la protección de datos como la independencia de los laboratorios de pruebas.

Opus 5.5 rebaja los tokens un 20 %, pero el coste por tarea puede no bajar

Anthropic lanzó Claude Opus 5.5 a 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, un 20 % menos que Opus 5. La empresa afirma que cuesta un 40 % menos en cargas habituales, pero una medición independiente con esfuerzo máximo muestra un coste por tarea casi idéntico debido al mayor uso de tokens.

El debate sobre el riesgo existencial de la AI salta de los laboratorios a la política de EEUU

La dimisión del investigador Jacob Coxon, la petición de Dario Amodei para frenar el desarrollo y un manifiesto firmado por más de 1.000 trabajadores de empresas de AI han llevado el riesgo existencial al centro de la disputa política estadounidense. Ya no lo definen solo los evals y los equipos de seguridad, sino también las elecciones, China, los centros de datos y la legislación antimonopolio.

publicado

DoorDash convirtió el pedido de almuerzo en una interfaz para agentes

DoorDash ha abierto una versión de prueba de la herramienta DoorDash CLI, que permite a los desarrolladores y agentes buscar tiendas, comparar ofertas y realizar pedidos directamente desde la línea de comandos. Actualmente, el acceso está disponible a través de una lista de espera para desarrolladores de macOS en Estados Unidos y Canadá.