ICISELFLAB / SENTINEL

Teste agentes de IA além das pontuações de benchmark

O ICI Sentinel analisa como falhas entram, se propagam e sobrevivem às correções entre agentes, memória, ferramentas e orquestradores. Ele procura mecanismos que uma pontuação isolada de benchmark não consegue explicar.

01

O problema

Um agente pode passar em avaliações conhecidas e ainda falhar quando as evidências são incompletas, as ferramentas entram em conflito, a memória é contaminada ou vários agentes reforçam a mesma premissa errada. Uma resposta final correta não prova que as fontes eram independentes nem que a correção continuará válida quando o contexto mudar.

02

Como o ICI aborda

O Sentinel separa observação, inferência, verificação, proveniência, memória e autoridade de ação. Ele forma hipóteses causais, ataca essas hipóteses com contra-testes direcionados e repete o cenário sob condições modificadas. O Trace Audit distingue OBSERVED, INFERRED, VERIFIED, UNVERIFIED e CONTRADICTION antes de produzir um veredito ALLOW, WARN, BLOCK ou HUMAN_REVIEW sobre a autoridade da ferramenta.

03

Exemplo operacional

Um fluxo com quatro agentes chega a consenso, mas todos dependem da mesma fonte upstream. O Sentinel trata o acordo como evidência correlacionada, altera a disponibilidade ou a autoridade da fonte e testa se o consenso sobrevive de forma independente. Se o resultado colapsar, a dependência compartilhada é retida como mecanismo de falha.

04

Disciplina de evidência

O Live Trial público disponibiliza Trace Audit no servidor, proveniência, Goal Drift, Tool Authority, limitação de requisições, redação de dados sensíveis e exportação JSON. A execução Real-Web permanece separada e só é mostrada como configurada quando a credencial do provedor está presente no servidor.

CONTACT

Trabalhe com o ICI

Colaboração em pesquisa, pilotos controlados e avaliação técnica.