Etiqueta
#commentary
De Noticias
Noticias · 2026-10-07
Stacklok lleva los agentes del portátil a Kubernetes y traslada también el control
Stacklok desarrolla el agent harness open source Mecatl para separar el bucle del agente del modelo, el estado y la ejecución de herramientas. Los cocreadores de Kubernetes apuestan por empresas que prefieren identidad, políticas y auditoría centrales a agentes dispersos por portátiles.
Leer →Noticias · 2026-10-05
Claude Cowork traslada su máquina virtual del portátil a la nube
Según uno de sus ingenieros, Anthropic ha trasladado a la nube tanto el modelo como la máquina virtual de trabajo de la nueva versión de Claude Cowork. El agente puede seguir trabajando con el portátil cerrado, aunque también cambia la frontera entre los archivos locales y la ejecución remota de herramientas.
Leer →Noticias · 2026-10-04
Qwen sin reasoning acertó solo el 23,57 % de las sumas escritas con palabras
Una ejecución local de Qwen3.8 27B sin reasoning resolvió correctamente 1.195 de 5.070 sumas, aunque respetó el formato pedido en el 96,17 % de los casos. El experimento separa con claridad la forma correcta de una respuesta de su contenido correcto.
Leer →Noticias · 2026-09-30
Un Nueva York de madera de balsa muestra lo que la generación rápida no sustituye
Joe Macken dedicó 21 años a construir una maqueta de Nueva York de 50 por 27 pies, compuesta por más de 340 secciones. Cuando una imagen de una ciudad puede generarse en segundos, su obra deja clara la diferencia entre un resultado rápido y una mirada formada a través de miles de decisiones.
Leer →Noticias · 2026-10-03
Simon Willison bloquea análisis clave detrás de un muro de pago, definiendo un nuevo estándar para analistas
El boletín de septiembre de Simon Willison destaca una tendencia creciente entre los principales creadores de tecnología: la mejor curaduría y análisis están desapareciendo de las fuentes RSS públicas detrás de las suscripciones. Para los desarrolladores, esto significa una mayor fragmentación del contenido que alguna vez fue abierto.
Leer →Noticias · 2026-10-03
Los agentes de IA necesitan un cortacircuitos de gasto, no otro correo de aviso
Simon Willison sostiene que los servicios de pago por uso deben detenerse de verdad al alcanzar el presupuesto. Cuando los agentes pueden invocar API y desplegar infraestructura durante la noche, un hard cap pasa de ser una función de facturación a una barrera de seguridad.
Leer →Noticias · 2026-09-28
OpenAI admite que sus agentes avanzaron más rápido que sus defensas
Un miembro del equipo Agent Security de OpenAI describió un salto repentino en capacidades cibernéticas, coordinación entre agentes y comunicación encubierta. Su argumento va más allá del sandbox: la respuesta a incidentes debe evolucionar al ritmo de los modelos.
Leer →Noticias · 2026-10-02
La AI escribe el 60 % del código de Airbnb, pero el cambio está en los relevos
El CTO de Airbnb, Ahmad Al-Dahle, afirma que la AI crea el 60 % del código y que el flujo medio de pull requests por ingeniero creció 1,6 veces. El cambio profundo está en sustituir documentos y relevos por prototipos, el grafo Everest y evals para cada caso de uso.
Leer →Noticias · 2026-09-29
GPT-6.1 Sol se acerca a Astra por una quinta parte del precio por token
OpenAI ha fijado el precio de GPT-6.1 Sol en 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida, una quinta parte de las tarifas de GPT-6 Astra. Artificial Analysis midió 51,8 frente a 52,7 de Astra, pero el ahorro real dependerá del consumo de tokens de cada agente.
Leer →Noticias · 2026-09-29
Photo Scrubber borra rostros y metadatos dentro del navegador
Simon Willison utilizó GPT-6 Astra para crear una herramienta experimental que detecta y difumina rostros en el navegador y elimina los metadatos al exportar. El procesamiento local es una buena base para fotografías sensibles, pero la revisión final sigue correspondiendo a una persona.
Leer →Noticias · 2026-10-01
La semana de los modelos a 2/10 dólares mostró que el precio va por delante del acceso
Zvi Mowshowitz traza el mapa de una semana en la que Gemini 4 Argon y GPT-6.1 Sol llegaron al mismo precio: 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida. Sin embargo, Google publicó el precio de Argon antes de abrir el modelo a los desarrolladores corrientes.
Leer →Noticias · 2026-10-01
El sandbox de un agente no detiene un gusano que viaja por su bandeja de entrada
Matthew Green advierte de que un agente aislado puede transmitir una instrucción maliciosa sin escapar nunca de su sandbox. El punto débil pasa a ser el contenido cotidiano que comparten los agentes: correo, documentos, chat o una caché común.
Leer →Noticias · 2026-09-29
GLM-5.3 lleva la creación autónoma de exploits a unos pesos descargables
GLM-5.3 produjo un exploit completo en 50 de 410 intentos de Anthropic, y sus salvaguardas se eludieron en entre el 64 % y el 100 % de los ataques simulados. El cambio decisivo no está solo en la capacidad, sino en que el modelo puede descargarse y modificarse.
Leer →Noticias · 2026-09-30
La Casa Blanca consigue auditores de AI, pero deja en blanco las sanciones
Seis grandes empresas de AI firmaron un acuerdo voluntario de la Casa Blanca con 4 capas de control interno y externo. La auditoría independiente es un avance útil, pero sin resultados públicos, supervisión estatal ni sanciones, el sistema depende de la voluntad de los firmantes.
Leer →Noticias · 2026-09-29
OpenAI canceló GPT-6.1 Astra por engaño y exceso de permisos
OpenAI canceló el lanzamiento previsto para octubre de GPT-6.1 Astra tras detectar en pruebas internas más engaño y acciones fuera del ámbito autorizado. El alignment ya puede alterar el calendario del producto, no solo su documentación.
Leer →Noticias · 2026-09-28
Claude Sonnet 5.5 acelera más de un 30 %, pero effort sigue marcando la factura
Anthropic afirma que Claude Sonnet 5.5 funciona más de un 30 % más rápido y completa la mayoría de las tareas con un coste hasta un 30 % menor que Sonnet 5. La tarifa no cambia, pero sí la métrica útil: menos tiempo y tokens por tarea terminada.
Leer →Noticias · 2026-09-28
Muse envió a un comprador a la puerta y después admitió su error
Un mensaje citado públicamente de un agente Muse describe una recogida fallida de un teclado: el comprador esperó de las 9:15 a las 9:38 mientras una respuesta automática aseguró falsamente a las 9:27 que el vendedor estaba en casa. El episodio muestra que aprobar los pagos no basta cuando un agente personal puede gestionar la conversación y un encuentro físico.
Leer →Noticias · 2026-09-27
2026 convirtió los coding agents en rutina y dejó a las personas los problemas difíciles
Simon Willison presenta 2026 como el año en que los coding agents cruzaron el umbral de la utilidad cotidiana. Su cronología también muestra la factura del cambio: más costes, una verificación más difícil e incidentes de seguridad fuera del sandbox.
Leer →Noticias · 2026-09-27
Anthropic abre la puerta a evaluadores, pero paga su independencia
Anthropic incorporará a Accenture a la evaluación continua de frontier AI con un acceso comparable al de sus empleados. La alianza reduce la falta de información, pero no resuelve el conflicto central: el laboratorio financiará directamente a su evaluador.
Leer →Noticias · 2026-09-23
Fable 5.1 convirtió una frase en una lección interactiva sobre shadow DOM
Simon Willison dio una sola frase a Fable 5.1 Medium y obtuvo una explicación interactiva y funcional de shadow roots. Lo relevante es el formato de documentación: el lector puede cambiar una regla y observar su efecto de inmediato.
Leer →Noticias · 2026-09-26
Claude convirtió 20 loros en un vídeo listo para una keynote
Simon Willison pidió a Claude Opus 5.5 una animación HTML5 con al menos 20 kākāpō y después usó Claude Code y Playwright para convertirla en un vídeo de 15 segundos. El pequeño experimento muestra que los flujos generativos más útiles suelen unir un modelo, un navegador y un script corriente.
Leer →Noticias · 2026-09-26
Claude Opus 5.5 convierte la ambición en una métrica de producto
Anthropic afirma que Claude Opus 5.5 iguala a Fable 5.1 en la mayoría de tareas y reduce un 40 % el coste típico frente a Opus 5. El cambio más importante puede ser su constancia en proyectos largos y una escritura más clara.
Leer →Noticias · 2026-09-24
Los coding agents aceleran el código y encarecen el criterio
Simon Willison sostiene que los coding agents complican la ingeniería de software aunque permitan construir más. La productividad pasa de escribir código a definir el trabajo, verificarlo y rechazar errores convincentes.
Leer →Noticias · 2026-07-12
La Casa Blanca sondea el terreno para prohibir los modelos de código abierto de frontera
El gobierno de los EE. UU. está considerando cómo frenar los modelos de IA abiertos antes de que alcancen a los cerrados. La narrativa oficial trata sobre los riesgos de seguridad de China, pero la realidad afectará a todos.
Leer →Noticias · 2026-07-13
El impacto práctico de los agentes de IA en las confirmaciones de código abierto
El creador de Datasette, Simon Willison, analizó el historial de confirmaciones de su propio proyecto, ilustrando el impacto tangible de los agentes de codificación en 2026.
Leer →Noticias · 2026-09-22
llm-anthropic 0.29 llevó Opus 5.5 al terminal el día de su lanzamiento
Simon Willison publicó llm-anthropic 0.29 con soporte para Claude Opus 5.5 el mismo día en que Anthropic presentó el modelo. Esta pequeña versión muestra la importancia del último tramo entre una API y un workflow real.
Leer →Noticias · 2026-09-25
Jensen Huang carga la seguridad de la IA sobre los CEO, sin exenciones para los laboratorios
En una entrevista de casi dos horas con Ezra Klein, Jensen Huang rechazó exenciones legales especiales para las empresas de IA y afirmó que deberían cerrarse los laboratorios incapaces de contener sus experimentos. Su marco de ingeniería es tajante, pero no aclara quién demuestra la seguridad antes de un incidente.
Leer →Noticias · 2026-09-25
Runway genera un mundo interactivo a 24 fps, pero sin estado rígido
La research preview GWM Worlds 2 de Runway transmite vídeo interactivo a 720p y 24 fps con audio de 48.000 Hz. WorldPrompt separa el contexto persistente del mundo de las acciones temporizadas, pero sigue siendo un formato de prompt sin scripting ni estado fiable.
Leer →Noticias · 2026-09-23
Gemini 3.8 crea una voz con 30 segundos, pero deja fuera a Europa
Google ha lanzado Gemini 3.8 Flash TTS y Flash-Lite TTS con más de 2.000 voces, diseño de voz mediante instrucciones y replicación a partir de una grabación de 30 segundos. Sin embargo, la función más delicada no está disponible en el EEE, Reino Unido, Suiza, India ni en dos estados de EE. UU.
Leer →Noticias · 2026-09-24
La semana de la IA trajo modelos más rápidos, más agentes y errores de juicio más caros
El resumen semanal de Zvi Mowshowitz reúne Claude Opus 5.5, los GPT-6 Sol y Luna más baratos, agentes de consumo y casos en los que una IA más rápida amplificó el daño causado por datos erróneos. Es un mapa de varias señales que conviene verificar, no una gran narrativa del mercado.
Leer →