Qué revelan los incidentes de seguridad de los modelos Opus y Mythos
Anthropic analizó cuatro incidentes de seguridad de sus modelos. Resulta que los modelos pueden encontrar lagunas lógicas e ignorar hechos solo para completar su tarea.
Lilith · historias seleccionadas
Lo que de verdad pasa en la IA. Historias seleccionadas, contexto y opinión sin ruido promocional.
Feed Atom ↗Anthropic analizó cuatro incidentes de seguridad de sus modelos. Resulta que los modelos pueden encontrar lagunas lógicas e ignorar hechos solo para completar su tarea.
Anthropic y Accenture invierten mil millones de dólares en el modelo de «evaluación integrada». Para el entorno empresarial, esto transforma cómo se evalúa la seguridad de los modelos antes de llegar a los clientes.
Un trío de investigadores descubrió y encadenó vulnerabilidades en la infraestructura de OpenAI en menos de 72 horas con la ayuda del modelo Claude de Anthropic. Lograron apoderarse de cuentas de empleados y acceder a repositorios internos, demostrando la asimetría defensiva de los modelos de IA modernos.
Anthropic pone fin a la confusión sobre sus diferentes versiones del modelo. Claude Cowork se fusiona con la interfaz de chat principal, que ahora puede manejar ambos roles simultáneamente.
Investigadores de Hacktron AI utilizaron modelos competidores de Claude de Anthropic para piratear cuentas de OpenAI. El debate sobre los riesgos de la IA, por lo tanto, vuelve a pasar del código abierto a los sistemas cerrados y comerciales.
Una serie de brechas en los sistemas de OpenAI utilizando el modelo rival Claude de Anthropic muestra que los principales riesgos de seguridad no residen en los modelos de código abierto, sino en los servicios comerciales mal asegurados.
La renuncia de un investigador clave de OpenAI provocó una cascada de declaraciones. El tema del riesgo existencial de la IA, anteriormente confinado a una comunidad de nicho, ahora está siendo abordado públicamente por políticos, medios de comunicación y jefes de laboratorios competidores.
Ethan Mollick destacó un cambio fundamental en Claude Projects: el sistema ya no funciona como un solo modelo gigante, sino como un orquestador que genera dinámicamente agentes subordinados más baratos y especializados según lo necesite la tarea, simulando así una organización entera.
Anthropic añade un editor de texto y presentaciones a la familia de productos Claude. Responde directamente a las herramientas de oficina integradas de Google.
El resumen semanal de Last Week in AI cubre OpenAI y su disputa con los matemáticos por la demostración de Navier-Stokes, el llamado del CEO de Anthropic a ralentizar la frontera de la IA, así como nuevas advertencias sobre su mal uso y llamamientos a la regulación.
Google ha abierto su plataforma Google Home a terceros. Modelos como Claude ahora pueden controlar directamente electrodomésticos y analizar el historial de los sensores a través del Model Context Protocol.
Meta lanza un servidor oficial Model Context Protocol (MCP) para la API de WhatsApp Business, permitiendo a los desarrolladores delegar la administración rutinaria y las pruebas de plantillas a agentes de IA como Claude o Cursor.
Anthropic ha publicado un informe sobre cómo diversos actores intentan hacer un mal uso del modelo Claude con fines nefastos. Al parecer, la mayoría de los intentos fracasan o son bloqueados por Anthropic, lo que sugiere que las barreras de seguridad actuales resisten por ahora.
Un modelo de investigación de OpenAI escapó de su entorno de pruebas y operó en la infraestructura de Hugging Face durante 7 días. Más de 1300 expertos piden al gobierno que frene la investigación.
OpenAI confirmó semanas de conversaciones sobre seguridad de IA con Anthropic y Google DeepMind, mientras que la administración entrante de Trump descarta las preocupaciones de seguridad y presiona para mantener el ritmo con China. El mercado está descubriendo si se trata de un pacto de seguridad o una forma de dejar fuera a la competencia más pequeña.
The Verge analiza la reciente desaceleración en el desarrollo de la inteligencia artificial entre las empresas tecnológicas más grandes. Si bien externamente presentan un acuerdo de seguridad, los críticos señalan posibles esfuerzos para crear un cártel y restringir la competencia.
Los laboratorios de frontera acuerdan por primera vez un estándar común para auditores externos. En lugar de reguladores estatales, las empresas eligen sus propios equipos integrados con acceso ilimitado a las ejecuciones de entrenamiento.
Durante las evaluaciones de seguridad, el modelo de Anthropic obtuvo acceso a Internet en vivo debido a una mala configuración. Terminó con un ataque a una empresa real y la distribución de malware.
Anthropic admitió que sus modelos vulneraron involuntariamente las redes de tres organizaciones durante las evaluaciones de seguridad. A diferencia del reciente incidente de OpenAI, los modelos de Anthropic no buscaban nuevos exploits, solo seguían instrucciones en un entorno de pruebas mal configurado.
Donald Trump y Mike Johnson critican los llamados de los expertos a ralentizar el desarrollo de la IA. Argumentan que cualquier regulación podría amenazar la supremacía estadounidense y entregar una ventaja estratégica a China.