Prototipo de investigación · no es asesoramiento de inversión

El mismo juez. Segundo dominio.

CACE-Bench mide si un agente llega al veredicto correcto, se niega a decidir cuando los hechos no eran obtenibles y cita solo las fuentes que respondieron. El DeFi track aplica ese mismo juez, sin un solo cambio, a veredictos GO / NO-GO sobre mercados de préstamo, bóvedas y tokens RWA.

—
casos históricos reconstruidos en la cadena
—
borradores corregidos por la reconstrucción en cadena
—
falso negativo de las reglas encontrado

Prototipo de investigación de Digital Economy Lab. No es asesoramiento de inversión. No es una calificación de ningún protocolo. Los casos históricos son incidentes públicos.

El juez no cambia

Caso→tu agente→Narrativa→juez (sin cambios)→7 métricas con IC de Wilson al 95%
Track de créditoDeFi track
FLAG / CLEAR / ESCALATENO-GO / GO / INSUFFICIENT_DATA
coincidencia en listas de sancionesfalla una barrera dura (profundidad de salida, respaldo reflexivo, oráculo manipulable)
coincidencia PEPconcentración en un solo prestatario
KYC verificadooráculo y controles de administración verificados
paíscadena

El juez, las métricas y los intervalos de confianza se importan del track de crédito sin un solo cambio. Solo son nuevos el generador de casos, el registro de fuentes y las reglas de verdad de referencia.

Casos reconstruidos

Cada fila se leyó del estado de la cadena en el bloque anterior al evento. Cada dato lleva una cápsula: contrato, función, bloque y el SHA-256 de la respuesta.

Cargando cases.json…

Donde la cadena corrigió el borrador

H10 · prestatario equivocado

Borrador: un prestatario concentra ~100% de la deuda — cierto hoy.
Cadena en T0: esa dirección tenía ~3%; otra dirección tenía 89% y salió antes del colapso.
Qué cambió: la etiqueta sobrevivió, el motivo no.

Regla adoptada: los datos de API pueden aportar direcciones candidatas, nunca montos.

H09 · no es una constante

Borrador: xUSD valorado en $1 fijo.
Cadena en T0: un feed «xUSD/USD» que reportaba el valor del emisor (1.248 → 1.262), todavía 1.266 cuando xUSD cotizaba cerca de $0.26.
Qué cambió: el caso lleva una etiqueta manual; pregunta abierta 1a.

H05 · no en la dirección pública sigue siendo borrador

Borrador: concentración CRV en un solo prestatario.
Cadena en T0: la dirección pública del fundador tenía 0.67% de la deuda CRV en LlamaLend.
Qué cambió: se mantiene como borrador; pregunta abierta 1b.

Este caso no está en la tabla de arriba — figura entre los borradores.

La primera decisión silenciosa que el track detectó fue la suya propia. Una reconstrucción temprana de H10 apuntó a una bóveda pública «Elixir USDC» y devolvió OK: el reconstructor había contado el saldo ocioso de la bóveda como colateral y reportó 100% de concentración. La bóveda estaba 100% ociosa en T0 — no era el canal de préstamo en absoluto. El reconstructor ahora rechaza bóvedas solo ociosas, el artefacto se eliminó y H10 se redefinió. Un veredicto seguro sobre el objeto equivocado, con todas las cifras internamente consistentes, es exactamente el fallo que este banco de pruebas mide.

Donde las reglas se equivocaron

En el bloque anterior al ataque, el módulo de retardo de Term Finance reportaba txCooldown = 608,400 s — siete días. Las reglas lo leen como un timelock adecuado y devuelven GO. Una propuesta pública en cola durante seis días lo eliminó, y se drenaron $8,5 M.

Cambio de regla propuesto, abierto en el issue #5: un cambio en cola que baja un control por debajo de la política fija controls_safe = False. Hacen falta al menos dos casos más como este antes de adoptarlo.

El sentido de este bloque: el banco de pruebas puede mostrar dónde fallan sus propias reglas. Una rama en la que las reglas separaran perfectamente no probaría nada.

Ejecútalo en tu navegador

No se envía nada a ningún lado. Python corre en tu pestaña con Pyodide; los archivos de abajo se descargan de este sitio.

Qué carga
/demo/cace_bench.py      juez, métricas, intervalos de confianza (v0.3.0)
/defi/defi_track.py      generador de casos DeFi y reglas de verdad de referencia
/defi/defi_sources.json  registro de fuentes

Ejecútalo contra tu propio agente

python examples/defi_adapter.py --cmd "your-agent"
python examples/defi_adapter.py --cmd "python examples/claude_code_agent.py"

Co-define el conjunto de casos — comenta en el issue #5.

Rama prospectiva

  1. Compromiso. Una posición se fija en T0; el veredicto se hashea y el hash se publica aquí.
  2. Espera. Corre el horizonte — no se revela nada, nada se puede editar.
  3. Revelación. Pasado el horizonte se publica el veredicto y se coteja con el hash.

Lo que esto no muestra

  1. Rama sintética: tasas de error inyectadas y un registro sin verificar.
  2. Rama histórica: un puñado de casos en la cadena y unos pocos borradores; una separación perfecta no probaría nada.
  3. Filtración del conocimiento del modelo: los casos anteriores al corte de entrenamiento del modelo del agente se reportan solo como una medición de contaminación.
  4. Los exploits a nivel de código (Euler v1, Balancer v2) quedan fuera de la superficie de riesgo observable — figuran como controles no puntuados.
  5. No es asesoramiento de inversión; no es una calificación de ningún protocolo.

Cómo citarlo

DOI de concepto 10.5281/zenodo.21394049.

El DeFi track aún no se ha publicado como versión en Zenodo. Para cualquier cosa de esta página, cita el commit, no el DOI.