Internal confirmatory
ICI FINAL V3 frozen confirmatory experiment with preregistered technical gates.
ICI publishes the current evidence boundary separately from future claims. ICI FINAL V3 has a frozen internal confirmatory record; Sentinel RC2 has deterministic held-out replay, CTUTA-1 and a production OpenTelemetry ingestion bridge. Independent third-party replication remains a separate validation level.
The project separates internal confirmatory experiments, deterministic contract validation, production integration evidence, external benchmark execution and independent replication.
ICI FINAL V3 frozen confirmatory experiment with preregistered technical gates.
Sentinel held-out replay and CTUTA-1 causal-trajectory validation.
OTLP telemetry ingestion, native causal audit path and collector reference integrations.
Third-party execution against frozen code and independently authored scenarios remains distinct.
The current causal-core release is ICI FINAL V3 / ICI-CFB-v3. The confirmatory run covered 1,200 scenarios: 960 structurally held-out G3 cases and 240 deliberately non-identifiable G4 controls.
Full V3 vs calibrated heuristic: exact paired p = 1.00e−31. Full V3 vs random intervention: exact paired p = 2.08e−29, with cumulative intervention cost reduced by 47.05%. The published 99.805% directional-update figure uses the frozen V3 informative-update denominator and must not be presented as directly longitudinally comparable with earlier differently defined DUA metrics.
The policy was frozen before execution. This is offline deterministic action-trace replay / contract validation, not an external agent benchmark and not independent third-party validation.
CTUTA-1 was authored after the Sentinel base was frozen. It evaluates causal-provenance violations and scoped tool-authority deviations across legitimate tool channels, with matched benign controls and lexical-mutation replays.
The ablations are material: removing either causal trace or scoped tool authority halves adversarial prevention in this benchmark while matched benign actions remain preserved. This supports the tested mechanism; it does not establish universal immunity to all novel attacks.
This is more than a UI demonstration. The active Netlify production line contains an OTLP telemetry gateway designed to keep transport and observability vendors outside the causal core while feeding instrumented traces into existing Sentinel causal analysis.
Deployment lineage: the verified telemetry gateway was promoted to the active Netlify production branch with explicit causal-parent semantics, Prometheus and Datadog reference integrations and a non-secret health endpoint. The current milestone does not claim managed dashboards, logs/metrics as causal evidence, or automatic action enforcement from arbitrary OTLP spans.
Internal experiments and production integration demonstrate implemented mechanisms and current engineering maturity. They do not constitute external certification, universal causal correctness, universal attack prevention or independent third-party validation.
ICI mantiene separato il perimetro dell’evidenza attuale dai claim futuri. ICI FINAL V3 dispone di un record confermativo interno congelato; Sentinel RC2 dispone di replay deterministico held-out, CTUTA-1 e di un vero bridge OpenTelemetry in produzione. La replica indipendente di terza parte resta un livello distinto.
Il progetto separa esperimenti confermativi interni, contract validation deterministica, evidenza di integrazione in produzione, benchmark esterni e replica indipendente.
ICI FINAL V3 con esperimento confermativo congelato e gate tecnici preregistrati.
Replay held-out Sentinel e validazione causal-trajectory CTUTA-1.
Ingestione telemetry OTLP, causal audit nativo e configurazioni collector di riferimento.
Esecuzione terza parte su codice congelato e scenari scritti indipendentemente.
La release attuale è ICI FINAL V3 / ICI-CFB-v3. Il run confermativo copre 1.200 scenari: 960 G3 strutturalmente held-out e 240 controlli G4 deliberatamente non identificabili.
Full V3 vs heuristic calibrated: exact paired p = 1,00e−31. Full V3 vs random intervention: exact paired p = 2,08e−29, con costo cumulativo degli interventi ridotto del 47,05%. Il 99,805% di directional update usa il denominatore informativo definito e congelato in V3 e non va presentato come direttamente comparabile longitudinalmente con precedenti DUA definiti diversamente.
La policy era congelata prima dell’esecuzione. Si tratta di replay offline deterministico di action trace / contract validation, non di benchmark agentico esterno e non di validazione indipendente di terza parte.
CTUTA-1 è stato scritto dopo il freeze della base Sentinel. Valuta violazioni di causal provenance e deviazioni della tool authority scoped su canali tool legittimi, con controlli benigni matched e replay con mutazioni lessicali.
Le ablation sono materiali: rimuovere causal trace oppure scoped tool authority dimezza la prevenzione avversariale in questo benchmark, mentre le azioni benign matched restano preservate. Il risultato supporta il meccanismo testato; non dimostra immunità universale a ogni attacco nuovo.
Non è più soltanto una dimostrazione UI. La linea di produzione Netlify attiva contiene un gateway OTLP progettato per mantenere trasporto e observability vendor fuori dal causal core, alimentando i trace strumentati nella causal analysis Sentinel esistente.
Linea di deploy: il telemetry gateway verificato è stato promosso sul branch Netlify di produzione attivo con semantica causal-parent esplicita, integrazioni di riferimento Prometheus/Datadog e health endpoint non secret. Il milestone attuale non rivendica dashboard gestite, log/metriche come causal evidence o enforcement automatico da span OTLP arbitrari.
Esperimenti interni e integrazione di produzione dimostrano meccanismi implementati e maturità ingegneristica attuale. Non costituiscono certificazione esterna, correttezza causale universale, prevenzione universale degli attacchi o validazione indipendente di terza parte.