Evidence dashboard
信任主張,必須能被檢查。
每個公開數字都能追溯到 checksummed artifact bundle。缺少的證據維持「尚未測量」,不填成零,也不暗示結果。
Valid Recall@1+33.3 pp
4/6 → 6/6
Forbidden exposure−33.3 pp
2/6 → 0/6
Mean overhead+0.1482
毫秒
Ranking stability30 / 30
五次重複查詢排序一致
配對結果
沒有替換 retrieval,也能改善治理品質。
mem0 2.0.12 · infer=False · top-1 · candidate pool 4 · 12 documents · 五次 clean-state processes。
Valid Recall@1
六案例中返回預期有效證據的比例
Forbidden-exposure rate
六案例中暴露無效證據的比例
來源:publication bundle vaultgovbench-retrieval-v0.1/89b9156 的五次 digest-bound repeats。重複測試的是單一 fixture 的 deterministic reproducibility,不是五個獨立統計樣本。
案例層級證據
六種 retrieval 本身無法治理的失效模式。
治理案例
只有 mem0
mem0 + Vault
過時的時間事實
暴露舊資料
阻擋並選出有效版本
私人存取邊界
有效
有效
已刪除 ghost memory
有效
有效
TTL 過期
有效
有效
被新版取代
暴露舊版本
阻擋並選出新版
隱私阻擋
有效
有效
保護成本
治理 overhead 必須測量,不能藏起來。
Latency 只報同一 track 的 paired delta,不做跨 provider 原始速度排行榜。
Baseline mean747.7018
ms
Governed mean747.8500
ms
Paired delta+0.1482
ms
P95 paired delta mean:+0.0592 ms。這是五次 per-repeat P95 的平均,不是 pooled P95。Provider/API cost 未測量,因此不顯示成零。
證據覆蓋
Published、Diagnostic、Unmeasured 明確分開。
| Track | 狀態 | 目前能支持的主張 | Artifact |
|---|---|---|---|
| mem0 + Vault | Published | 固定六案例中的治理改善與 paired overhead | Summary JSON |
| Vault standalone | Published | 內建 keyword track 可重現且零禁止暴露 | Summary JSON |
| AgentMemory + Vault | Diagnostic | 只有本機方向性結果,尚未通過 clean blinded publication gate | 診斷紀錄 |
| Letta / MemGPT + Vault | Unmeasured | 不做品質主張 | N/A |
主張邊界
這證明治理合約,不證明普遍優於所有記憶系統。
Fixture 是公開、synthetic、retrieval-only、top-1,且刻意包含無效記憶案例。它不是端到端 QA,也不是官方 LoCoMo、LongMemEval 或 vendor leaderboard。