同一句任务在不同时间得到不同结果,不一定是“模型变笨了”。记忆、当前会话、工作区文件、项目指令、专家配置和所选模型都可能改变输入上下文。
要稳定结果,先知道系统参考了什么。
记忆会保存什么
官方文档说明,WorkBuddy 会从会话历史中提取有参考价值的事实、偏好习惯、人物关系和近期跟进事项,并定期更新记忆摘要。记忆默认开启,仅用于为本人提供个性化回应。
这有助于记住常用格式和背景,也可能带来三类问题:
- 过时偏好继续影响新任务。
- 模型对会话做了不准确概括。
- 对话中包含的他人信息被提取为记忆。
记忆应被当作可编辑的数据,不是永远正确的事实库。
查看和清理记忆
从头像进入“设置 - 记忆”,逐条检查:
- 是否仍然准确。
- 是否确实有助于后续任务。
- 是否包含无权长期保存的他人信息。
- 是否与当前项目规则冲突。
- 是否应该删除或改写为更中性的偏好。
例如“所有内容都写得活泼”很容易影响正式报告。更可控的写法是“个人社交内容偏好轻松语气;正式业务材料以任务说明为准”。
什么时候关闭记忆
- 在共享设备或演示环境中使用。
- 处理一次性敏感项目。
- 需要做模型和提示词的严格对照测试。
- 记忆频繁造成上下文冲突。
- 组织政策不允许从会话提取个人偏好。
关闭后仍要检查现有记忆条目,并清理不应保留的内容。
上下文的常见来源
一个任务可能同时受到:
| 来源 | 典型内容 | 风险 |
|---|---|---|
| 当前提示词 | 本次目标与约束 | 表述不完整 |
| 当前会话 | 前几轮讨论 | 旧假设未更新 |
| 个人记忆 | 偏好与背景 | 过时或概括错误 |
| 工作区 | 本地文件 | 版本冲突、范围过大 |
| 项目 | 指令、资产、工具 | 团队规则覆盖个人习惯 |
| 专家/Skill | 方法与执行能力 | 隐含工具和权限 |
当结果异常时,按来源逐层排除,比反复重写一句提示词更有效。
Auto 模型适合什么
Auto 会根据任务选择模型,适合普通办公和对模型没有强约束的新手任务。它减少选择成本,但也让跨时间对照更难,因为实际模型可能变化。
以下情况适合固定模型做测试:
- 长文档、复杂表格或大代码库。
- 对输出格式一致性要求高。
- 需要控制速度或积分。
- 正在评估一个 Skill 或自动化是否稳定。
- 任务包含特定多模态能力。
固定模型也不代表永久最佳,版本和产品策略都会变化。
比较模型时控制变量
准备一个小样本,用相同提示词、工作区、记忆状态、专家和 Skill 分别测试。记录:
- 完成时间。
- 积分或费用。
- 格式通过率。
- 事实错误数量。
- 工具调用成功率。
- 人工修改时间。
只比较“看起来更聪明”很容易被措辞影响。用真实验收指标决定。
自定义模型的安全边界
官方文档说明自定义模型配置和 API Key 保存在本地 workbuddy/models.json。但任务内容会按你的配置发送给第三方模型服务,因此还要检查:
- 服务商的数据保留和训练政策。
- API Key 的权限、额度和有效期。
- 代理地址或兼容接口是否可信。
- 团队设备上的本地文件访问权限。
- 日志、备份和远程支持是否可能暴露配置。
不要把 API Key 粘贴到任务对话或项目资产中。离职、设备更换或不再使用时及时吊销。
处理上下文冲突
如果项目指令要求正式语气,个人记忆偏好轻松表达,应在本次任务明确优先级:
本任务以项目指令和我提供的最新材料为最高优先级。
个人记忆只用于不冲突的格式偏好;
若当前材料、项目资料和记忆存在冲突,请列出冲突,不要自行选择旧信息。
对日期、价格、版本和政策等易变化事实,不应依赖记忆,必须回到当前资料核验。
完成检查
- 已查看并清理过期或不应保留的记忆。
- 知道何时关闭记忆做隔离测试。
- 能列出当前任务的主要上下文来源。
- 模型比较使用同一样本和验收指标。
- 自定义模型凭据没有进入对话或共享资产。