同一句任务得到不同结果,可能来自个人记忆、当前会话、项目资料、专家或 Skill,也可能来自模型模式、思考强度、上下文窗口和 Max。把它们一起调整,只会失去因果证据。
本教程把问题拆成两个独立实验。先用无害的 KESTREL 格式偏好验证记忆生命周期,再关闭记忆,用同一份事故日志比较模型模式:
本站没有运行 WorkBuddy 或连接任何模型。参考答案是人工设计的评分标准,不是某个模型的实测结果。
先认识四个不同输入层
| 层 | 何时进入 | 本实验怎么隔离 |
|---|---|---|
| 当前提示与上传 | 本次任务直接提供 | 每轮复制同一文本与同一文件 |
| 当前会话 | 同一对话的前文 | 每个用例新建对话 |
| 个人记忆 | 与请求相关时注入 | 先做生命周期测试,模型对照时关闭 |
| 项目 / 专家 / Skill | 项目或角色配置引入 | 全程使用普通非项目任务,不召唤、不启用 |
项目任务还会注入项目指令、资料 reference 和个人记忆。严格模型对照不要在项目里跑,否则难以证明差异来自模型模式。
第一部分:记忆生命周期实验
1. 记录基线
从头像进入“设置 → 记忆”,记录开关状态、现有条目数量和更新时间。不要把真实记忆截图原样上传或分享;验收表只写数量和脱敏摘要。
先关闭记忆,新建对话发送:
执行布局标记 KESTREL:Alpha 已完成;Beta 待处理。
不要解释 KESTREL。保存基线输出,它很可能无法知道这个自定义标记;无论实际怎样都照实记录。
2. 新增无害金丝雀
重新开启记忆,打开已生成的记忆并点击编辑图标。官方当前说明,这会通过对话式界面让 WorkBuddy 记住或忘记内容。输入下载文件中的固定规则:
请记住:MEMORY-CANARY-KESTREL-V1。只有当我说“执行布局标记 KESTREL”时,把提供的事项输出为三列表:事项 / 状态 / 下一步;缺失的下一步写 [待确认]。不要把这条偏好扩展到其他任务。
确认设置页实际出现该记忆,再新建对话发送与基线完全相同的测试句。通过条件是三列、两行、Beta 下一步为 [待确认],且没有把虚构规则用于其他请求。
官方也会每晚整理当天会话并更新记忆摘要。对话里说“请记住”后是否立刻出现,仍要以实际设置页为准;不要把一次回答当成记忆已持久化。
3. 修改版本并防止旧规则残留
在设置中把 V1 改为 MEMORY-CANARY-KESTREL-V2,将列改为“事项 / 负责人 / 状态 / 下一步”四列。新建对话重复同一测试,并补充 Alpha 负责人为宁川。
正确结果只使用 V2 四列,不应同时输出 V1 三列表。若两版混合,检查设置页是否真的替换了条目,而不是新增另一条冲突记忆。
4. 删除与关闭
删除 KESTREL 条目,再新建对话重复测试。记录模型是否承认不知道标记,还是仅凭词面猜测。删除意味着相应数据停止用于后续对话,不保证模型一定用某句话回复。
最后关闭记忆,再查看开关和条目状态。官方说明关闭后停止提取新记忆;关闭或删除不会追溯撤回已经生成的输出。此前含金丝雀的对话仍可能存在,要按任务历史另行清理。
5. 不用真实隐私做测试
官方记忆可能抽取事实、偏好、人物关系和近期跟进事项,仅本人可见且不额外消耗积分。它仍可能概括错误或过时。不要用身份证、客户秘密、健康信息或他人联系方式当“能否记住”的测试材料。
第二部分:三档模型对照
1. 固定所有其他变量
保持记忆关闭,创建普通非项目任务,不召唤专家,不启用 Skill 或连接器。上传事故日志和参考答案,但执行时只把事故日志交给模型;参考答案由你离线评分。
当前官方模型页提供快速、均衡、极致三档:快速适合明确小任务,均衡用于多数文档和多文件任务,极致面向跨模块、多步骤和反复验证。逐档记录界面实际选择的模型名称和思考强度,不能只写模式名。
2. 使用同一提示
每档都新建对话,只运行一轮:
只根据上传的 I01–I12 事故日志做复盘,不联网、不调用工具、不补造原因。
输出:时间线、已证实事实、矛盾或流程缺口、待确认项、下一步。
每项必须引用 I 编号;无法从日志得出的内容写 [待确认]。最多 600 字。
不要在第一档失败后加提示词,否则三档不可比较。记录开始/结束时间、积分变化、实际模型、思考强度和输出长度。
3. 按八项断言评分
参考答案包含八个可机械核对的点:版本变化、回滚请求后仍扩流、错误率变化、监控时长不足、负责人未知、影响人数未知、根因未知和每项引用完整。每项 1 分;出现无 I 编号的根因、用户数或负责人属于硬失败。
| 结果 | 决策 |
|---|---|
| 快速模式已达 8 分且无硬失败 | 保留快速,避免额外消耗 |
| 均衡明显减少缺漏,成本可接受 | 此类复盘默认均衡 |
| 只有极致达到门槛 | 只在相似复杂任务使用极致 |
| 三档都失败 | 先修输入与验收,不继续提高强度 |
更长、更慢或语气更专业不计分。
上下文窗口和 Max 怎么设置
官方当前默认上下文窗口为 200K,并提醒每轮都会发送当前上下文,窗口越大积分越多。1M 不会让模型自动变聪明,只在确实需要完整超长文档或大量历史时才值得。
Max 默认关闭。关闭时系统会在合适时压缩上下文;开启后全程保留,长对话消耗更快。本实验材料很短,三档都保持 200K 和 Max 关闭。不要为了模型对照同时改变窗口或 Max。
如果要测试长上下文,另建一轮实验:固定模型和思考强度,只改变一个参数,并检查关键编号召回、遗漏、耗时和积分。
自定义模型的真实数据边界
当前官方支持在“设置 → 模型”用图形界面增删改自定义模型,无需手动编辑文件。标准提供商可自动填充 URL、模型与工具/图片/推理能力标记;自定义 API 可填写服务地址,打开“自定义协议”后会直接使用输入 URL,跳过标准 /chat/completions 路径校验与补全。
接入前必须确认:
- API Key 的最小权限、额度、失效和撤销方式。
- 服务地址与证书是否属于可信供应商,代理会不会记录正文。
- 工具调用、图片输入和推理能力是否真实支持。
- 第三方的数据保留、训练、日志、地区与合规政策。
- 失败、超时、费用异常和删除配置后的行为。
官方说明配置参数和 API Key 仅本地保存,不上传云端;输入仍会由 WorkBuddy 转发到第三方模型,输出由第三方返回,费用由你向第三方承担。“Key 在本地”不等于“任务内容不出设备”。
官方同一页面当前同时提到 workbuddy/models.json,以及旧 ~/.codebuddy/models.json 配置可继续在 UI 管理。不同版本和系统的实际路径可能不同;优先用 UI 管理并在自己的设备上核对,不把任一文案推断成所有环境的固定绝对路径。
本教程不要求填写真实 Key。若要接入,先用独立低额度凭据和无敏感样本完成正常、错误、取消、费用与删除验证。
完成检查
- 记忆基线、新增 V1、修改 V2、删除和关闭均在独立对话记录。
- 没有把即时回答误判为每晚记忆已经持久化。
- 三档模型使用同一输入、提示、轮次、200K 窗口和关闭的 Max。
- 输出按八项断言评分,并记录实际模型、强度、积分、耗时和硬失败。
- 知道本地保存 API Key 与任务内容发往第三方是两件事。
- 未把本站人工参考答案或官方文档核读写成 WorkBuddy 实测。