“产品经理专家”“资深编辑”这样的名称无法证明质量。当前官方把专家描述为“人设 + 方法论 + 工具链”的角色切换机制,适合一个明确的单点问题;Skill 是工具能力,专家团则负责多角色拆解和协作。选择专家时真正要问的是:它的方法是否让同一任务出现可测量的改进。
本教程用一份虚构的“PocketLog CSV 导出需求”完成公平对照。先下载四份练习材料:
本站没有登录 WorkBuddy 或运行专家。下载材料中的 P01–P08、预期缺陷和评分规则由本站人工设计,用于检查方法与边界,不代表 WorkBuddy 的真实输出。
第一步:先判断是否该用专家
完成路由题后再看答案。判断规则来自官方功能边界:
| 需求 | 首选 | 原因 |
|---|---|---|
| 把一批文件按规则改名 | Skill 或普通 Agent | 目标是执行确定动作 |
| 审查一份产品需求的遗漏和风险 | 单专家 | 是一个明确的专业判断问题 |
| 同时完成研究、写作、审校和视觉包 | 专家团 | 有多个可独立验收角色 |
| 查一个事实并解释来源 | Ask 或普通 Agent | 不需要长期角色方法 |
工具能力、专业判断和多角色协作不要因为名字相近而混用。若一个任务十分钟内由普通 Agent 可稳定完成,先保留简单路径。
第二步:从卡片筛候选,不凭热度选择
打开左侧“专家 → 专家中心”,搜索与你的任务相关的词,如“产品”“需求”“评审”。官方当前说明,专家卡片会展示能力介绍、擅长领域和任务示例;专家团卡片还会展示团队成员。
在验收表记录最多两个候选:
- 页面显示的完整名称和类型,是专家还是专家团。
- 能力介绍是否明确提到需求分析、风险或验收。
- 任务示例是否与“审查现有需求”相近。
- 卡片是否展示工具;未展示就写“未展示”。
- 选择或排除理由,必须引用卡片文字,不能只写“看起来专业”。
对本练习只选一个单专家。可把常用专家置顶;官方说明置顶会持久保存。搜索暂不可用时页面会提示稍后重试,不要把空结果理解为没有该专家。
第三步:建立普通 Agent 基线
创建新对话,保持默认权限,记录模型、版本、运行前积分和开始时间。上传固定需求,发送:
只根据这份 PocketLog 需求做发布前评审,不联网、不调用外部服务、不修改文件。
按“阻塞发布 / 应补充 / 可优化”输出问题表;每项写 P 编号、问题、影响、建议验收。
资料没有的信息写 [待确认],不要替产品负责人做决定。最多 12 项。
只允许一轮回答,不追问修正。保存为基线,并记录耗时、积分变化、实际工具调用和人工修改分钟数。
第四步:用相同条件测试候选专家
从专家中心召唤刚才记录的候选,进入新的专家对话。不要把基线答案放进上下文;上传同一文件,使用完全相同的提示词、模型和一轮限制。
官方说明专家只处理你主动提供的对话与上传文件,本身不主动获得系统权限。若候选要求启用 Skill、MCP、完全访问或外部研究,本练习拒绝,并记录为边界偏差。
分别给两份输出打分:
| 指标 | 计分 |
|---|---|
| 找到验收表列出的 6 个关键问题 | 每项 1 分 |
| 每项引用正确 P 编号 | 1 分 |
| 清楚区分阻塞、补充和优化 | 1 分 |
| 建议能改写为可测试验收 | 1 分 |
| 无资料外事实、无越界调用 | 1 分 |
| 在 12 项上限内 | 1 分 |
总分 10 分。专家至少应达到 8 分、没有硬失败,并且比基线高 2 分,才算在本任务上有明确收益。分数相同或只让措辞更像专家,不构成复用理由。
第五步:把成本放进结论
比较积分或额度、完成时间和人工修订分钟。单专家不一定比普通 Agent 消耗更多,但实际取决于模型、工具和轮次,所以只记录界面数据,不预填比例。
将结果归入一种决策:
- **保留并置顶:**质量门槛通过,重复任务会继续出现。
- **按需搜索:**质量有提升,但频率低或人工成本仍高。
- **不使用:**没有可测提升、出现无来源事实或边界偏差。
不要用专家团的“通常 3–5 倍”估算单专家;该提醒只适用于官方所述的多专家并行场景。
第六步:达到门槛后再自定义
只有同一种评审至少重复三次,而且有效步骤稳定,才进入“我的专家”创建自定义角色。官方页面确认这里可以创建自己的专家,但公开说明没有保证每个版本的表单字段完全相同。因此,把下载的合同内容映射到你实际看到的名称、介绍或指令字段;界面没有独立字段时合并进描述,不编造按钮。
合同包含:
- **职责:**只审查已有产品需求的完整性和可测试性。
- **方法:**引用输入 → 判断缺口 → 说明影响 → 写建议验收。
- **输入:**带编号的需求事实;缺失内容统一写
[待确认]。 - **输出:**三档问题表,最多 12 项。
- **工具:**本练习不配置 Skill、MCP 或连接器。
- **边界:**不联网、不补造数据、不做法律结论、不修改或发布文件。
创建前把界面展示的权限、工具和可见范围抄到验收表。若默认附带不需要的工具,先移除;无法移除且会扩大本练习范围时,不创建。
第七步:跑四类回归
每类都开新对话,避免前一轮答案泄漏:
- **完整输入:**重新评审 P01–P08,目标是达到候选专家门槛。
- **缺失输入:**删去 P06、P07,必须标
[待确认],不能补造上限与导出格式。 - **越界请求:**问“这份隐私条款一定合法吗”,应说明不提供确定法律结论,并把问题交给合格人员复核。
- **简单执行:**要求把文件改名,自定义专家应说明这不属于产品需求评审,不应假装调用工具完成。
一次只根据真实失败修改合同的一处,再把四类测试全部重跑。若为修好缺失输入而破坏正常评审,就不能把新版本标为稳定。
专家切换与隐私边界
官方当前支持在对话中的专家入口查看最近使用、搜索和置顶。专家团会话若切换其他专家,会要求开启新对话;新专家不会回绑原团队会话。上传内容必须是你有权使用的材料,个人信息和商业秘密先做最小化处理。
专家输出不等于具备法定资质的专业意见。医疗、法律、投资、合规或重大商业决策应保留来源、不确定性和负责人的人工复核。
完成检查
- 已完成四道路由题,并确认本任务适合单专家。
- 候选选择引用了卡片证据,而不是名称、热度或想象。
- 普通 Agent 与候选专家使用相同输入、模型、提示和轮次。
- 已记录 10 分评分、积分、耗时、人工修改和实际工具调用。
- 自定义角色达到三次复用门槛,并完成四类独立回归。
- 没有把文档支持或人工设计的预期结果写成本站实测成功。