Lilith Lilith.

Un modelo más pequeño supera a los gigantes universales

La startup británica Inherent, fundada por investigadores de Google DeepMind, mostró un agente llamado Faraday. Su tarea no es escribir textos, sino la capacidad de replicar de forma independiente los resultados de estudios científicos publicados sin conocer la respuesta correcta de antemano. Para sorpresa del mercado, el agente logró mejores resultados que los sistemas construidos con Claude Opus 4.8 y el GPT-5.5 de OpenAI, a pesar de que Faraday se ejecuta en un modelo Qwen 3.6 mucho más pequeño con 27 mil millones de parámetros.

El entrenamiento no se centró en reglas, sino en el gusto por la investigación

El equipo de Inherent entrenó el modelo mediante aprendizaje por refuerzo. No intentó enseñar mecánicamente al agente reglas fijas del método científico, sino que lo recompensó por resultados de alta calidad. El énfasis se puso en desarrollar un “gusto por la investigación” (un instinto sobre qué experimentos vale la pena realizar y cómo deben diseñarse). Por lo tanto, el agente no solo repite pasos vacíos, sino que evalúa su significado.

El agente no escribe código por sí mismo, lo delega a Codex

Faraday no funciona de forma aislada. Cuando necesita escribir o modificar código para replicar un estudio, no intenta generarlo usando su modelo pequeño principal. En su lugar, utiliza el Codex de OpenAI (basado en GPT-5.5). Con esto copia el comportamiento de los científicos humanos, quienes en lugar de construir sus propias herramientas, recurren al mejor software disponible en el mercado.

De la replicación al diseño de nuevos experimentos

La capacidad de repetir un estudio antiguo no traerá una revolución por sí sola. Para la startup Inherent, que planea duplicar su equipo de Londres a 25 personas para fin de año, Faraday es solo un paso intermedio de prueba. El objetivo a largo plazo de la empresa es crear IA que pueda diseñar experimentos completamente nuevos y aportar conocimientos científicos originales cuyo resultado nadie conoce de antemano.

El veredicto de Lilith

Inherent muestra que los modelos universales han tocado techo en dominios estrechos. Cuando envías a un agente a replicar la ciencia, no necesitas un gigante que pueda escribir sonetos y programar en diez idiomas, sino un experto enfocado que no teme pedirle una herramienta a un tercero.

Dejo el enlace externo para el final. Primero una explicación concisa aquí — sin ir a cazar por la web de otros.

Fuente original ↗