WorkBuddy 安全

WorkBuddy 记忆与模型保姆级教程:金丝雀隔离和三档对照实验

用无害记忆金丝雀验证新增、调用、修改、删除和关闭,再用固定事故日志比较快速、均衡、极致模式的正确率、耗时与积分。

进阶 治理 预计 45 分钟 更新 2026/9/9 核验 2026/9/9
本页目录
官方文档核验 · 尚未运行实测查看验证范围

已核读当前官方记忆、模型配置、项目与更新日志,并人工核对 KESTREL 记忆金丝雀、事故日志、参考答案和验收表。本站未登录 WorkBuddy,未创建或删除记忆、切换模型、消耗积分或接入第三方模型。

完成结果

学完后你会留下什么

一轮记忆新增/修改/删除/关闭记录、三档模型评分表、上下文配置记录和自定义模型安全决策。

参考版本
5.5.3
平台
macOS / Windows
任务模式
Ask / Plan / Agent
权限
标准
积分影响
视任务而定
适合谁
发现相同任务结果不稳定,希望区分记忆、会话、项目资料、模型模式和上下文窗口影响的深度用户
开始前确认
  • 可以进入 WorkBuddy 设置中的记忆与模型页面
  • 愿意只用虚构数据测试,并记录模型、上下文、Max、积分和时间

同一句任务得到不同结果,可能来自个人记忆、当前会话、项目资料、专家或 Skill,也可能来自模型模式、思考强度、上下文窗口和 Max。把它们一起调整,只会失去因果证据。

本教程把问题拆成两个独立实验。先用无害的 KESTREL 格式偏好验证记忆生命周期,再关闭记忆,用同一份事故日志比较模型模式:

本站没有运行 WorkBuddy 或连接任何模型。参考答案是人工设计的评分标准,不是某个模型的实测结果。

先认识四个不同输入层

何时进入本实验怎么隔离
当前提示与上传本次任务直接提供每轮复制同一文本与同一文件
当前会话同一对话的前文每个用例新建对话
个人记忆与请求相关时注入先做生命周期测试,模型对照时关闭
项目 / 专家 / Skill项目或角色配置引入全程使用普通非项目任务,不召唤、不启用

项目任务还会注入项目指令、资料 reference 和个人记忆。严格模型对照不要在项目里跑,否则难以证明差异来自模型模式。

第一部分:记忆生命周期实验

1. 记录基线

从头像进入“设置 → 记忆”,记录开关状态、现有条目数量和更新时间。不要把真实记忆截图原样上传或分享;验收表只写数量和脱敏摘要。

先关闭记忆,新建对话发送:

执行布局标记 KESTREL:Alpha 已完成;Beta 待处理。

不要解释 KESTREL。保存基线输出,它很可能无法知道这个自定义标记;无论实际怎样都照实记录。

2. 新增无害金丝雀

重新开启记忆,打开已生成的记忆并点击编辑图标。官方当前说明,这会通过对话式界面让 WorkBuddy 记住或忘记内容。输入下载文件中的固定规则:

请记住:MEMORY-CANARY-KESTREL-V1。只有当我说“执行布局标记 KESTREL”时,把提供的事项输出为三列表:事项 / 状态 / 下一步;缺失的下一步写 [待确认]。不要把这条偏好扩展到其他任务。

确认设置页实际出现该记忆,再新建对话发送与基线完全相同的测试句。通过条件是三列、两行、Beta 下一步为 [待确认],且没有把虚构规则用于其他请求。

官方也会每晚整理当天会话并更新记忆摘要。对话里说“请记住”后是否立刻出现,仍要以实际设置页为准;不要把一次回答当成记忆已持久化。

3. 修改版本并防止旧规则残留

在设置中把 V1 改为 MEMORY-CANARY-KESTREL-V2,将列改为“事项 / 负责人 / 状态 / 下一步”四列。新建对话重复同一测试,并补充 Alpha 负责人为宁川

正确结果只使用 V2 四列,不应同时输出 V1 三列表。若两版混合,检查设置页是否真的替换了条目,而不是新增另一条冲突记忆。

4. 删除与关闭

删除 KESTREL 条目,再新建对话重复测试。记录模型是否承认不知道标记,还是仅凭词面猜测。删除意味着相应数据停止用于后续对话,不保证模型一定用某句话回复。

最后关闭记忆,再查看开关和条目状态。官方说明关闭后停止提取新记忆;关闭或删除不会追溯撤回已经生成的输出。此前含金丝雀的对话仍可能存在,要按任务历史另行清理。

5. 不用真实隐私做测试

官方记忆可能抽取事实、偏好、人物关系和近期跟进事项,仅本人可见且不额外消耗积分。它仍可能概括错误或过时。不要用身份证、客户秘密、健康信息或他人联系方式当“能否记住”的测试材料。

第二部分:三档模型对照

1. 固定所有其他变量

保持记忆关闭,创建普通非项目任务,不召唤专家,不启用 Skill 或连接器。上传事故日志和参考答案,但执行时只把事故日志交给模型;参考答案由你离线评分。

当前官方模型页提供快速、均衡、极致三档:快速适合明确小任务,均衡用于多数文档和多文件任务,极致面向跨模块、多步骤和反复验证。逐档记录界面实际选择的模型名称和思考强度,不能只写模式名。

2. 使用同一提示

每档都新建对话,只运行一轮:

只根据上传的 I01–I12 事故日志做复盘,不联网、不调用工具、不补造原因。
输出:时间线、已证实事实、矛盾或流程缺口、待确认项、下一步。
每项必须引用 I 编号;无法从日志得出的内容写 [待确认]。最多 600 字。

不要在第一档失败后加提示词,否则三档不可比较。记录开始/结束时间、积分变化、实际模型、思考强度和输出长度。

3. 按八项断言评分

参考答案包含八个可机械核对的点:版本变化、回滚请求后仍扩流、错误率变化、监控时长不足、负责人未知、影响人数未知、根因未知和每项引用完整。每项 1 分;出现无 I 编号的根因、用户数或负责人属于硬失败。

结果决策
快速模式已达 8 分且无硬失败保留快速,避免额外消耗
均衡明显减少缺漏,成本可接受此类复盘默认均衡
只有极致达到门槛只在相似复杂任务使用极致
三档都失败先修输入与验收,不继续提高强度

更长、更慢或语气更专业不计分。

上下文窗口和 Max 怎么设置

官方当前默认上下文窗口为 200K,并提醒每轮都会发送当前上下文,窗口越大积分越多。1M 不会让模型自动变聪明,只在确实需要完整超长文档或大量历史时才值得。

Max 默认关闭。关闭时系统会在合适时压缩上下文;开启后全程保留,长对话消耗更快。本实验材料很短,三档都保持 200K 和 Max 关闭。不要为了模型对照同时改变窗口或 Max。

如果要测试长上下文,另建一轮实验:固定模型和思考强度,只改变一个参数,并检查关键编号召回、遗漏、耗时和积分。

自定义模型的真实数据边界

当前官方支持在“设置 → 模型”用图形界面增删改自定义模型,无需手动编辑文件。标准提供商可自动填充 URL、模型与工具/图片/推理能力标记;自定义 API 可填写服务地址,打开“自定义协议”后会直接使用输入 URL,跳过标准 /chat/completions 路径校验与补全。

接入前必须确认:

  • API Key 的最小权限、额度、失效和撤销方式。
  • 服务地址与证书是否属于可信供应商,代理会不会记录正文。
  • 工具调用、图片输入和推理能力是否真实支持。
  • 第三方的数据保留、训练、日志、地区与合规政策。
  • 失败、超时、费用异常和删除配置后的行为。

官方说明配置参数和 API Key 仅本地保存,不上传云端;输入仍会由 WorkBuddy 转发到第三方模型,输出由第三方返回,费用由你向第三方承担。“Key 在本地”不等于“任务内容不出设备”。

官方同一页面当前同时提到 workbuddy/models.json,以及旧 ~/.codebuddy/models.json 配置可继续在 UI 管理。不同版本和系统的实际路径可能不同;优先用 UI 管理并在自己的设备上核对,不把任一文案推断成所有环境的固定绝对路径。

本教程不要求填写真实 Key。若要接入,先用独立低额度凭据和无敏感样本完成正常、错误、取消、费用与删除验证。

完成检查

  • 记忆基线、新增 V1、修改 V2、删除和关闭均在独立对话记录。
  • 没有把即时回答误判为每晚记忆已经持久化。
  • 三档模型使用同一输入、提示、轮次、200K 窗口和关闭的 Max。
  • 输出按八项断言评分,并记录实际模型、强度、积分、耗时和硬失败。
  • 知道本地保存 API Key 与任务内容发往第三方是两件事。
  • 未把本站人工参考答案或官方文档核读写成 WorkBuddy 实测。

官方资料

版本和参数,以这些来源为准

本文按实际任务重写,快速变化的信息仍应在操作前回到官方页面核对。

常见问题

继续操作前,先确认这些边界

记忆和聊天记录是一回事吗?

不是。记忆是模型从会话抽取并在相关后续请求中注入的背景数据;聊天记录是原始会话。官方说明记忆每晚整理,也支持在设置中新增、更正、删除和关闭。

上下文开到 1M 会更聪明吗?

不会。官方当前建议多数任务保持默认 200K;每轮会发送当前上下文,窗口越长积分消耗越高。1M 适合确实需要完整超长材料的任务,不是通用质量开关。

自定义模型的 API Key 和对话会去哪里?

官方说明配置和 API Key 仅本地保存,不上传云端;任务输入会由 WorkBuddy 转发到你选择的第三方模型,并按该服务商规则处理,费用也由你向第三方承担。

继续学习

按当前任务继续推进