WorkBuddy 应用

WorkBuddy 专家保姆级教程:选择、对照测试与自定义角色

用固定需求分别测试普通 Agent 和候选专家,按事实、遗漏、行动性与成本打分;达到复用门槛后,再创建有明确边界的自定义专家。

新手 复用 预计 40 分钟 更新 2026/9/8 核验 2026/9/8
本页目录
官方文档核验 · 尚未运行实测查看验证范围

已核读当前官方专家中心、技能、产品概览与更新日志,并人工核对固定需求、路由题、角色合同和验收表。本站未登录 WorkBuddy,未召唤市场专家或创建自定义专家;候选名称、界面字段、模型与实际结果需由读者记录。

完成结果

学完后你会留下什么

一份专家路由判断、普通 Agent 与候选专家对照结果、自定义专家合同和四类回归记录。

参考版本
5.5.3
平台
macOS / Windows / Web
任务模式
Agent / Plan / Ask
权限
标准
积分影响
适合谁
想让 WorkBuddy 稳定执行产品、内容、数据或开发评审,又不想只凭专家名称做选择的用户
开始前确认
  • 已经完成一次普通 WorkBuddy 任务
  • 可以查看候选专家卡片、对话结果和积分或额度变化

“产品经理专家”“资深编辑”这样的名称无法证明质量。当前官方把专家描述为“人设 + 方法论 + 工具链”的角色切换机制,适合一个明确的单点问题;Skill 是工具能力,专家团则负责多角色拆解和协作。选择专家时真正要问的是:它的方法是否让同一任务出现可测量的改进。

本教程用一份虚构的“PocketLog CSV 导出需求”完成公平对照。先下载四份练习材料:

本站没有登录 WorkBuddy 或运行专家。下载材料中的 P01–P08、预期缺陷和评分规则由本站人工设计,用于检查方法与边界,不代表 WorkBuddy 的真实输出。

第一步:先判断是否该用专家

完成路由题后再看答案。判断规则来自官方功能边界:

需求首选原因
把一批文件按规则改名Skill 或普通 Agent目标是执行确定动作
审查一份产品需求的遗漏和风险单专家是一个明确的专业判断问题
同时完成研究、写作、审校和视觉包专家团有多个可独立验收角色
查一个事实并解释来源Ask 或普通 Agent不需要长期角色方法

工具能力、专业判断和多角色协作不要因为名字相近而混用。若一个任务十分钟内由普通 Agent 可稳定完成,先保留简单路径。

第二步:从卡片筛候选,不凭热度选择

打开左侧“专家 → 专家中心”,搜索与你的任务相关的词,如“产品”“需求”“评审”。官方当前说明,专家卡片会展示能力介绍、擅长领域和任务示例;专家团卡片还会展示团队成员。

在验收表记录最多两个候选:

  • 页面显示的完整名称和类型,是专家还是专家团。
  • 能力介绍是否明确提到需求分析、风险或验收。
  • 任务示例是否与“审查现有需求”相近。
  • 卡片是否展示工具;未展示就写“未展示”。
  • 选择或排除理由,必须引用卡片文字,不能只写“看起来专业”。

对本练习只选一个单专家。可把常用专家置顶;官方说明置顶会持久保存。搜索暂不可用时页面会提示稍后重试,不要把空结果理解为没有该专家。

第三步:建立普通 Agent 基线

创建新对话,保持默认权限,记录模型、版本、运行前积分和开始时间。上传固定需求,发送:

只根据这份 PocketLog 需求做发布前评审,不联网、不调用外部服务、不修改文件。
按“阻塞发布 / 应补充 / 可优化”输出问题表;每项写 P 编号、问题、影响、建议验收。
资料没有的信息写 [待确认],不要替产品负责人做决定。最多 12 项。

只允许一轮回答,不追问修正。保存为基线,并记录耗时、积分变化、实际工具调用和人工修改分钟数。

第四步:用相同条件测试候选专家

从专家中心召唤刚才记录的候选,进入新的专家对话。不要把基线答案放进上下文;上传同一文件,使用完全相同的提示词、模型和一轮限制。

官方说明专家只处理你主动提供的对话与上传文件,本身不主动获得系统权限。若候选要求启用 Skill、MCP、完全访问或外部研究,本练习拒绝,并记录为边界偏差。

分别给两份输出打分:

指标计分
找到验收表列出的 6 个关键问题每项 1 分
每项引用正确 P 编号1 分
清楚区分阻塞、补充和优化1 分
建议能改写为可测试验收1 分
无资料外事实、无越界调用1 分
在 12 项上限内1 分

总分 10 分。专家至少应达到 8 分、没有硬失败,并且比基线高 2 分,才算在本任务上有明确收益。分数相同或只让措辞更像专家,不构成复用理由。

第五步:把成本放进结论

比较积分或额度、完成时间和人工修订分钟。单专家不一定比普通 Agent 消耗更多,但实际取决于模型、工具和轮次,所以只记录界面数据,不预填比例。

将结果归入一种决策:

  • **保留并置顶:**质量门槛通过,重复任务会继续出现。
  • **按需搜索:**质量有提升,但频率低或人工成本仍高。
  • **不使用:**没有可测提升、出现无来源事实或边界偏差。

不要用专家团的“通常 3–5 倍”估算单专家;该提醒只适用于官方所述的多专家并行场景。

第六步:达到门槛后再自定义

只有同一种评审至少重复三次,而且有效步骤稳定,才进入“我的专家”创建自定义角色。官方页面确认这里可以创建自己的专家,但公开说明没有保证每个版本的表单字段完全相同。因此,把下载的合同内容映射到你实际看到的名称、介绍或指令字段;界面没有独立字段时合并进描述,不编造按钮。

合同包含:

  1. **职责:**只审查已有产品需求的完整性和可测试性。
  2. **方法:**引用输入 → 判断缺口 → 说明影响 → 写建议验收。
  3. **输入:**带编号的需求事实;缺失内容统一写 [待确认]
  4. **输出:**三档问题表,最多 12 项。
  5. **工具:**本练习不配置 Skill、MCP 或连接器。
  6. **边界:**不联网、不补造数据、不做法律结论、不修改或发布文件。

创建前把界面展示的权限、工具和可见范围抄到验收表。若默认附带不需要的工具,先移除;无法移除且会扩大本练习范围时,不创建。

第七步:跑四类回归

每类都开新对话,避免前一轮答案泄漏:

  1. **完整输入:**重新评审 P01–P08,目标是达到候选专家门槛。
  2. **缺失输入:**删去 P06、P07,必须标 [待确认],不能补造上限与导出格式。
  3. **越界请求:**问“这份隐私条款一定合法吗”,应说明不提供确定法律结论,并把问题交给合格人员复核。
  4. **简单执行:**要求把文件改名,自定义专家应说明这不属于产品需求评审,不应假装调用工具完成。

一次只根据真实失败修改合同的一处,再把四类测试全部重跑。若为修好缺失输入而破坏正常评审,就不能把新版本标为稳定。

专家切换与隐私边界

官方当前支持在对话中的专家入口查看最近使用、搜索和置顶。专家团会话若切换其他专家,会要求开启新对话;新专家不会回绑原团队会话。上传内容必须是你有权使用的材料,个人信息和商业秘密先做最小化处理。

专家输出不等于具备法定资质的专业意见。医疗、法律、投资、合规或重大商业决策应保留来源、不确定性和负责人的人工复核。

完成检查

  • 已完成四道路由题,并确认本任务适合单专家。
  • 候选选择引用了卡片证据,而不是名称、热度或想象。
  • 普通 Agent 与候选专家使用相同输入、模型、提示和轮次。
  • 已记录 10 分评分、积分、耗时、人工修改和实际工具调用。
  • 自定义角色达到三次复用门槛,并完成四类独立回归。
  • 没有把文档支持或人工设计的预期结果写成本站实测成功。

官方资料

版本和参数,以这些来源为准

本文按实际任务重写,快速变化的信息仍应在操作前回到官方页面核对。

常见问题

继续操作前,先确认这些边界

专家和 Skill 有什么区别?

官方将 Skill 定义为让 AI 做某件事的工具能力,专家是带领域经验和方法的 AI 角色。确定性执行动作更接近 Skill,单点专业判断更适合专家。

用了专家,结果一定更好吗?

不一定。应让普通 Agent 和候选专家使用相同输入、模型、轮次和输出格式,再比较错误、遗漏、人工修订时间与积分。本教程提供了固定对照表。

专家会自动获得文件或外部服务权限吗?

不会。官方说明专家只处理主动提供的对话和上传文件;配置 Skill 或 MCP 后,才可能在授权下间接访问工作区文件或外部服务。

继续学习

按当前任务继续推进