FishMem

评估记忆循环

为写入、召回与下游回答建立贴近生产的验收集。

1. 采样代表性轨迹

选择脱敏的对话与来源文档,覆盖稳定偏好、更正、时间变化、模糊查询、缺失事实和租户边界。开发集与发布保留集分开。

2. 分四层评分

问题
写入是否提交了正确持久记录,且没有原文静默兜底?
状态更新、失效、历史与作用域是否正确?
召回是否选中必要记录,噪声是否可接受?
回答下游智能体是否只用允许上下文完成任务?

不要只看单个综合分数。保留逐项结果、失败类型与判定理由。

3. 冻结配置

记录代码提交、数据集版本、模型、嵌入模型、提示词、召回参数、过滤器、种子与运行环境。公开基准只证明该冻结配置,不保证生产负载表现。

4. 加入运维闸门

测量写入与搜索尾延迟、空召回、降级、额度结算、任务重试与删除。真实文件、真实项目边界、真实网络和目标部署必须至少跑一次。只有保留集、运行指标与恢复检查同时通过才发布。

当前公开证据

2026-08-24 冻结的评测组合在同一套公开配置下,对 FishMem 与 mem0 OSS 3.1.2 进行逐题配对比较。

测试集变体配对题数FishMemmem0差值(95% CI)
LongMemEvaloracle50088.2%83.8%+4.4 pt(+1.0 至 +7.8)
BEAM100k40046.7%41.0%+5.7 pt(+1.8 至 +9.5)
LoCoMo类别 1–51,98667.5%71.1%-3.7 pt(-5.8 至 -1.5)

三个结果都参与发布判断,LoCoMo 的败项没有被筛掉。LongMemEval oracle 不是 LongMemEval-S;当前产物也不足以支持公开的成本或端到端总耗时比较。 FishMem 在两个胜项上使用的召回上下文明显多于 mem0,因此上下文效率仍是 明确的后续优化项,而不是宣传主张。

On this page