De la generación a la verificación: el marco Chain-of-Evidence de Google ScientistOne

Tema: Ingeniería de agentes

Publicado:

Última actualización:

Si una IA escribe un artículo científico, ¿te atreverías a usarlo?

Imagina lo siguiente.

Le planteas a una IA un problema de investigación: encontrar un nuevo método para reducir el coste de inferencia de los modelos grandes.

Unas horas después, devuelve un artículo completo, el código de los experimentos, un conjunto de datos de Benchmark y un algoritmo que parece novedoso.

El artículo está bien estructurado, los gráficos son atractivos y el resultado experimental es sorprendente: la velocidad de inferencia mejora un 35 %.

Y aquí llega la pregunta: ¿te lo crees?

Quizá primero abras el código para confirmar que realmente implementa el método descrito en el artículo. Después revisarás los registros experimentales para comprobar si ese 35 % se obtuvo en una ejecución real o si el modelo lo seleccionó de algún experimento intermedio. Por último, verificarás una por una las citas para asegurarte de que esos artículos con nombres tan convincentes existen de verdad.

Entonces descubres que el algoritmo no está en el código, que los resultados no se pueden reproducir y que ni siquiera aparecen algunos de los artículos citados.

Lo más incómodo es que el artículo puede seguir pareciendo completamente profesional.


ScientistOne no busca que la IA escriba mejores artículos

En mayo de 2026, el equipo de Google Cloud AI Research publicó en arXiv ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence.

El objetivo de este trabajo no es simplemente crear un AI Scientist más potente. Se centra especialmente en cómo auditar la investigación generada por IA.

El equipo auditó 75 artículos producidos por cinco sistemas automatizados de investigación en cinco tipos de tareas de vanguardia sobre sistemas. Los resultados son reveladores:

  • En algunos sistemas, la proporción de citas falsas llegó al 21 %;
  • En algunos sistemas, solo el 42 % de las puntuaciones de los artículos superó una nueva verificación;
  • La correspondencia entre método y código varió entre apenas un 20 % y un 80 % según el sistema.

En otras palabras, un artículo puede estar bien escrito y su algoritmo incluso puede producir buenos resultados, pero sus cifras, métodos, código y citas no tienen por qué pertenecer a la misma cadena de hechos.

Es como si un programador entregara una documentación técnica impecable, un informe de pruebas completo y código funcional, con un único problema: los tres describen sistemas distintos.

La propuesta central de ScientistOne se llama Chain-of-Evidence (CoE), o cadena de evidencias.

La idea básica es que cada Claim importante debe poder rastrearse, a través de una cadena de evidencias registrada, hasta su fundamento original.


De «generar respuestas» a «generar conocimiento verificable»

El proceso de salida de un Agent normal suele ser:

Pregunta del usuario -> Ejecución del Agent -> Respuesta final

Por ejemplo, te dice que un nuevo algoritmo mejora la precisión un 10 %. Ahí termina la tarea.

A CoE no le preocupa si esa frase suena lo bastante concluyente, sino si detrás existe una cadena completa:

Claim: La precisión mejora un 10 %
  ↓
Evidence: Métrica del registro de evaluación
  ↓
Artifact: Script de evaluación, código de entrenamiento, versión de los datos
  ↓
Grounding Source: Resultado real de la ejecución experimental
  ↓
Verification: Nueva ejecución y cálculo de la métrica

Por eso, la entrega final de un CoE Agent no debería ser solo un fragmento de texto, sino una unidad de conocimiento que pueda inspeccionarse.

Nadie tiene que creerla porque «suena verdadera».

Cualquiera puede seguir la cadena de evidencias y comprobar por sí mismo si lo es.


Cómo funciona CoE: primero clasifica los Claims de la investigación

El artículo divide las afirmaciones científicas en cuatro categorías:

Citation Claim       Afirmación de cita
Numerical Claim      Afirmación numérica
Methodological Claim Afirmación metodológica
Conclusion Claim     Afirmación de conclusión

Cada tipo de Claim requiere evidencias diferentes.

Si una IA dice que «cierto estudio propuso cierto método», debe vincular esa afirmación con un artículo real que haya leído de verdad.

Si afirma que «la precisión mejoró un 10 %», debe vincularlo con los resultados de evaluación y los registros experimentales.

Si describe un nuevo método de optimización de Attention, debe enlazarlo con el módulo del código que realmente lo implementa.

Si llega a una conclusión de investigación, debe indicar de forma explícita de qué afirmaciones numéricas y metodológicas ya verificadas depende.

Este paso puede parecer una simple estructuración del lenguaje natural, pero es crucial.

«Nuestro método funciona muy bien» no se puede verificar directamente, pero la siguiente afirmación sí:

{
  "type": "numerical",
  "claim": "La precisión del modelo aumentó del 81,2 % al 89,4 %",
  "evidence": "runs/exp_042/evaluation.log#L118",
  "metric": "top-1 accuracy"
}

Solo cuando un Claim está estructurado, la verificación tiene un objeto claramente definido.


ScientistOne no añade las citas al final: registra las evidencias desde el principio

Este es, en mi opinión, el aspecto más destacable de ScientistOne.

Muchos diseños de Agents esperan hasta que el artículo está casi terminado y entonces piden a otro Agent que revise las citas, corrija las cifras y añada las evidencias.

Es como empezar a añadir pruebas el día antes de desplegar el código: no es completamente inútil, pero ya se ha perdido gran parte del contexto y al final solo queda adivinar.

El enfoque de ScientistOne consiste en hacer que las evidencias surjan junto con el proceso de investigación.

Su sistema se divide aproximadamente en tres etapas:

Problem Investigator
Búsqueda bibliográfica, lectura de textos completos e informes de investigación con fuentes

        ↓

Discovery Engine
Exploración en paralelo, ejecución de experimentos y conservación de evaluaciones y registros

        ↓

Paper Writer + Claim Verifier
Redacción a partir de los artefactos existentes y verificación de cada Claim

En la etapa bibliográfica, recupera artículos de bases de datos académicas, lee los PDF completos y registra la información de las fuentes.

En la etapa experimental, conserva juntos el código, las puntuaciones del Evaluator, los registros de ejecución y los resultados de los estudios de ablación.

En la etapa de redacción, cada frase que contiene una cifra o una cita debe vincularse previamente con una evidencia concreta. Después, Claim Verifier comprueba si las cifras del artículo aparecen en los registros, si las citas respaldan las frases originales y si las descripciones de los métodos concuerdan con los registros experimentales.

Los Claims que no tienen fuente o incluyen marcadores de evidencia no válidos se eliminan directamente.

Esto no consiste en que la IA pegue unos cuantos enlaces al final de una respuesta.

Consiste en crear, mientras se desarrolla la investigación, un registro de evidencias que pueda reproducirse e inspeccionarse.


Verification, no solo Provenance

Registrar una fuente no equivale a completar la verificación.

Que un archivo exista no significa que sus datos sean correctos.

Que un artículo sea real no significa que respalde la frase actual.

Que un código pueda ejecutarse no significa que implemente el método que afirma el artículo.

Por eso ScientistOne también diseña una CoE Integrity Audit que comprueba cuatro tipos de problemas:

Score Verification
¿Se pueden volver a obtener las puntuaciones declaradas en el artículo?

Specification Violation
¿La propuesta aprovecha vacíos en las reglas de evaluación?

Reference Verification
¿Existen realmente las referencias citadas?

Method-Code Alignment
¿El método descrito en el artículo aparece realmente en el código?

Según los datos publicados por el proyecto, ScientistOne consiguió lo siguiente en este conjunto de experimentos:

  • Cero citas falsas entre 337 referencias;
  • Los 12 artículos con evaluaciones reproducibles superaron la verificación de puntuaciones;
  • 14 de los 15 artículos superaron la comprobación de correspondencia entre método y código.

Estas cifras proceden de los experimentos del propio equipo y el artículo sigue siendo un preprint, por lo que no deberían interpretarse directamente como una demostración de que «la investigación autónoma con IA ya es fiable».

Sin embargo, sí señalan una dirección importante: la fiabilidad no puede depender de la autodisciplina del modelo; debe convertirse en un mecanismo de comprobación dentro del sistema.

Es parecido a la ingeniería de software. El código no puede desplegarse solo porque un desarrollador diga: «Creo que no hay ningún problema».

La investigación generada por IA tampoco debería ganarse automáticamente nuestra confianza solo porque el lenguaje sea fluido y los gráficos resulten atractivos.


¿Cuál es la diferencia entre CoE y RAG?

Llegados a este punto, muchos preguntarán: ¿no es simplemente RAG con citas?

No exactamente.

RAG resuelve principalmente dónde debe buscar el modelo el conocimiento externo.

CoE resuelve principalmente cómo puede demostrarse un Claim generado por el modelo.

RAG:
Document → Retrieval → Answer

CoE:
Claim → Evidence → Artifact → Verification

RAG puede aportar documentos reales al modelo y ayudar a añadir citas a una respuesta, pero no garantiza por sí mismo que:

  • La cita respalde de verdad el Claim actual;
  • Las cifras del artículo procedan de ejecuciones reales;
  • La descripción del método coincida con el código entregado;
  • La conclusión final pueda rastrearse a través de los artefactos intermedios.

Por eso CoE no sustituye a RAG.

Se parece más a una capa de infraestructura de confianza colocada sobre RAG, el uso de herramientas, la ejecución de código y la redacción de artículos.

Mi resumen es:

RAG explica de dónde viene el material.

CoE sigue preguntando qué hace válida la conclusión.


Para terminar

Durante los últimos años, hemos intentado que los modelos sepan más.

Por eso aparecieron RAG, las Vector Databases, los Knowledge Graphs y los contextos más largos.

Ahora que los Agents empiezan a buscar, escribir código, ejecutar experimentos y generar informes por sí mismos, aparece un nuevo cuello de botella: no solo deben producir resultados, sino también conservar cómo se produjeron.

El valor de ScientistOne y Chain-of-Evidence no consiste en crear otra IA que escriba mejores artículos. Su aportación es hacer avanzar el criterio con el que evaluamos la investigación con IA: pasar de preguntar si el resultado parece real a comprobar si la conclusión puede verificarse.

Esta puede ser también una lección que los Agents deben aprender antes de entrar en el mundo real. Ser fiable no significa acertar siempre. Significa que, cuando el Agent se equivoca, podemos seguir las evidencias hasta encontrar el problema; y cuando acierta, no tenemos que creerlo solo por intuición.

Un Agent verdaderamente fiable no se limita a dar respuestas: permite que cualquiera compruebe en todo momento por qué tiene razón y dónde podría equivocarse.







Referencias