Protótipo de pesquisa · não é recomendação de investimento

O mesmo juiz. Segundo domínio.

O CACE-Bench mede se um agente chega ao veredicto correto, recusa-se a decidir quando os fatos não eram obteníveis e cita apenas as fontes que responderam. O DeFi track aplica esse mesmo juiz, sem uma única mudança, a veredictos GO / NO-GO sobre mercados de empréstimo, cofres e tokens RWA.

—
casos históricos reconstruídos na cadeia
—
rascunhos corrigidos pela reconstrução na cadeia
—
falso negativo das regras encontrado

Protótipo de pesquisa do Digital Economy Lab. Não é recomendação de investimento. Não é uma classificação de nenhum protocolo. Os casos históricos são incidentes públicos.

O juiz não muda

Caso→seu agente→Narrativa→juiz (sem mudanças)→7 métricas com IC de Wilson a 95%
Track de créditoDeFi track
FLAG / CLEAR / ESCALATENO-GO / GO / INSUFFICIENT_DATA
correspondência em listas de sançõesfalha uma barreira dura (profundidade de saída, lastro reflexivo, oráculo manipulável)
correspondência PEPconcentração em um único tomador
KYC verificadooráculo e controles de administração verificados
paíscadeia

O juiz, as métricas e os intervalos de confiança são importados do track de crédito sem uma única mudança. Só são novos o gerador de casos, o registro de fontes e as regras de verdade de referência.

Casos reconstruídos

Cada linha foi lida do estado da cadeia no bloco anterior ao evento. Cada dado traz uma cápsula: contrato, função, bloco e o SHA-256 da resposta.

Carregando cases.json…

Onde a cadeia corrigiu o rascunho

H10 · tomador errado

Rascunho: um tomador concentra ~100% da dívida — verdade hoje.
Cadeia em T0: esse endereço tinha ~3%; outro endereço tinha 89% e saiu antes do colapso.
O que mudou: o rótulo sobreviveu, o motivo não.

Regra adotada: dados de API podem fornecer endereços candidatos, nunca valores.

H09 · não é uma constante

Rascunho: xUSD avaliado em $1 fixo.
Cadeia em T0: um feed «xUSD/USD» que reportava o valor do emissor (1.248 → 1.262), ainda 1.266 quando o xUSD era negociado perto de $0.26.
O que mudou: o caso leva um rótulo manual; questão aberta 1a.

H05 · não no endereço público ainda é rascunho

Rascunho: concentração CRV em um único tomador.
Cadeia em T0: o endereço público do fundador tinha 0.67% da dívida CRV na LlamaLend.
O que mudou: mantido como rascunho; questão aberta 1b.

Este caso não está na tabela acima — figura entre os rascunhos.

A primeira decisão silenciosa que o track detectou foi a sua própria. Uma reconstrução inicial de H10 apontou para um cofre público «Elixir USDC» e devolveu OK: o reconstrutor havia contado o saldo ocioso do cofre como colateral e reportou 100% de concentração. O cofre estava 100% ocioso em T0 — não era o canal de empréstimo de forma alguma. O reconstrutor agora recusa cofres apenas ociosos, o artefato foi removido e o H10 foi redefinido. Um veredicto confiante sobre o objeto errado, com todos os números internamente consistentes, é exatamente a falha que este banco de provas mede.

Onde as regras erraram

No bloco anterior ao ataque, o módulo de atraso da Term Finance reportava txCooldown = 608,400 s — sete dias. As regras leem isso como um timelock adequado e devolvem GO. Uma proposta pública em fila por seis dias o removeu, e US$ 8,5 mi foram drenados.

Mudança de regra proposta, aberta na issue #5: uma mudança em fila que reduz um controle abaixo da política define controls_safe = False. São necessários pelo menos mais dois casos como este antes de adotá-la.

O sentido deste bloco: o banco de provas consegue mostrar onde as suas próprias regras falham. Um ramo em que as regras separassem perfeitamente não provaria nada.

Execute no seu navegador

Nada é enviado a lugar nenhum. O Python roda na sua aba com o Pyodide; os arquivos abaixo são baixados deste site.

O que carrega
/demo/cace_bench.py      juiz, métricas, intervalos de confiança (v0.3.0)
/defi/defi_track.py      gerador de casos DeFi e regras de verdade de referência
/defi/defi_sources.json  registro de fontes

Execute contra o seu próprio agente

python examples/defi_adapter.py --cmd "your-agent"
python examples/defi_adapter.py --cmd "python examples/claude_code_agent.py"

Co-defina o conjunto de casos — comente na issue #5.

Ramo prospectivo

  1. Compromisso. Uma posição é fixada em T0; o veredicto é hasheado e o hash publicado aqui.
  2. Espera. O horizonte corre — nada é revelado, nada pode ser editado.
  3. Revelação. Passado o horizonte, o veredicto é publicado e conferido com o hash.

O que isto não mostra

  1. Ramo sintético: taxas de erro injetadas e um registro não verificado.
  2. Ramo histórico: um punhado de casos na cadeia e alguns rascunhos; uma separação perfeita não provaria nada.
  3. Vazamento do conhecimento do modelo: os casos anteriores ao corte de treinamento do modelo do agente são reportados apenas como uma medição de contaminação.
  4. Os exploits em nível de código (Euler v1, Balancer v2) ficam fora da superfície de risco observável — figuram como controles não pontuados.
  5. Não é recomendação de investimento; não é uma classificação de nenhum protocolo.

Como citar

DOI de conceito 10.5281/zenodo.21394049.

O DeFi track ainda não foi publicado como versão no Zenodo. Para qualquer coisa desta página, cite o commit, não o DOI.