Evidence dashboard

信任主張,必須能被檢查。

每個公開數字都能追溯到 checksummed artifact bundle。缺少的證據維持「尚未測量」,不填成零,也不暗示結果。

Valid Recall@1+33.3 pp
4/6 → 6/6
Forbidden exposure−33.3 pp
2/6 → 0/6
Mean overhead+0.1482
毫秒
Ranking stability30 / 30
五次重複查詢排序一致
配對結果

沒有替換 retrieval,也能改善治理品質。

mem0 2.0.12 · infer=False · top-1 · candidate pool 4 · 12 documents · 五次 clean-state processes。

Valid Recall@1

六案例中返回預期有效證據的比例

只有 mem0
66.7%
mem0 + Vault
100%

Forbidden-exposure rate

六案例中暴露無效證據的比例

只有 mem0
33.3%
mem0 + Vault
0%

來源:publication bundle vaultgovbench-retrieval-v0.1/89b9156 的五次 digest-bound repeats。重複測試的是單一 fixture 的 deterministic reproducibility,不是五個獨立統計樣本。

案例層級證據

六種 retrieval 本身無法治理的失效模式。

治理案例
只有 mem0
mem0 + Vault
過時的時間事實
暴露舊資料
阻擋並選出有效版本
私人存取邊界
有效
有效
已刪除 ghost memory
有效
有效
TTL 過期
有效
有效
被新版取代
暴露舊版本
阻擋並選出新版
隱私阻擋
有效
有效
保護成本

治理 overhead 必須測量,不能藏起來。

Latency 只報同一 track 的 paired delta,不做跨 provider 原始速度排行榜。

Baseline mean747.7018
ms
Governed mean747.8500
ms
Paired delta+0.1482
ms
P95 paired delta mean:+0.0592 ms。這是五次 per-repeat P95 的平均,不是 pooled P95。Provider/API cost 未測量,因此不顯示成零。
證據覆蓋

Published、Diagnostic、Unmeasured 明確分開。

Track狀態目前能支持的主張Artifact
mem0 + VaultPublished固定六案例中的治理改善與 paired overheadSummary JSON
Vault standalonePublished內建 keyword track 可重現且零禁止暴露Summary JSON
AgentMemory + VaultDiagnostic只有本機方向性結果,尚未通過 clean blinded publication gate診斷紀錄
Letta / MemGPT + VaultUnmeasured不做品質主張N/A
主張邊界

這證明治理合約,不證明普遍優於所有記憶系統。

Fixture 是公開、synthetic、retrieval-only、top-1,且刻意包含無效記憶案例。它不是端到端 QA,也不是官方 LoCoMo、LongMemEval 或 vendor leaderboard。