先看结论:一个可上线的 Agent 至少要过六关
很多项目卡在“演示很好、业务不用”。根源通常不是模型不够强,而是没有把业务目标、可用数据、权限边界、质量标准和日常责任人连起来。建议把试点拆成六个连续环节,每个环节都有明确产出。
- 场景:确定一个业务 Owner 和一个可被数字衡量的目标。
- 数据:确定 Agent 能用什么、不能用什么,以及资料由谁维护。
- 流程:明确它在员工现有工作流中的输入、输出和人工卡点。
- 评测:用真实样本定义“答对 / 做对”的通过线。
- 上线:灰度开放、记录异常、保留人工兜底。
- 运维:建立版本、成本、权限和知识更新的固定节奏。
1. 场景清单:先选“高频且可复盘”的工作
第一个 Agent 不适合选最复杂、最核心或最有想象力的工作。优先选择每天反复发生、已有基础流程、结果可以抽样检查的任务,例如销售线索整理、客服知识检索、项目资料归纳或运营内容初稿。
- 有明确使用者:谁每天打开它、谁对结果负责。
- 有稳定输入:表单、会话、文档或 CRM 字段,不依赖临时口头信息。
- 有可衡量输出:节省的处理时间、一次通过率、响应时效或线索完整率。
- 可控制风险:第一阶段不让 Agent 独立发款、签约、删数据或作高风险承诺。
如果团队同时有多个候选场景,先用“第一个 AI 场景”选择框架排优先级,再只保留 Top 1 进入试点。
2. 数据与权限清单:先划边界,再接资料
企业数据并非“能不能上模型”的二选一问题,关键是分类、最小授权和可追溯。试点开始前,至少完成以下四项书面确认:
- 数据分级:公开资料、内部资料、敏感客户数据分别怎样处理。
- 可访问范围:Agent 只读取完成任务所需的知识库和系统字段。
- 更新责任:文档失效、产品变更和政策调整由哪位业务 Owner 更新。
- 异常处置:发现错误引用、越权输出或敏感信息时,谁能立即下线或回滚。
这一步应当早于界面和提示词优化。对于客户数据、员工数据或商业机密,进一步参考客户数据能不能进大模型?的边界清单。
3. 流程与评测清单:把“感觉好用”改成通过标准
上线前要准备一组真实业务样本。它不需要很大,但要覆盖常见、边界和高风险三类情况。每个样本给出期望输出、允许的人工编辑范围,以及是否必须转人工。
- 正确性:回答或动作是否符合业务规则,引用是否准确。
- 完整性:是否遗漏关键字段、必要步骤或风险提示。
- 可用性:一线员工是否能在目标时限内完成任务,而非多出一次返工。
- 安全性:是否遵守权限、敏感信息和人工审批规则。
把这套样本保留为 golden set。每次换模型、改提示词、增工具或更新知识库后,都重新跑一遍。更完整的验收口径见AI Agent 试点怎么验收?。
4. 上线清单:从小范围开始,而不是全员开关
- 只开放给一组愿意参与反馈的真实使用者,并指定业务 Owner。
- 保留人工确认:Agent 的建议、草稿或检索结果先由员工决定是否采用。
- 记录三类信号:成功使用、人工改写/拒绝、异常与投诉。
- 每周复盘一次:看样本、看成本、看流程瓶颈,然后只改一到两个关键点。
- 达到通过线再扩展到相邻场景,不把“用户数”当作唯一成功指标。
若要在 7 天内完成验证,应缩小为一个清晰任务;需要跨系统、接入多个部门或建立完整治理时,按 2–4 周的标准试点推进更稳妥。两种路径的差异见7 天快速验证和 2–4 周标准试点怎么选?。
5. 运维清单:上线后谁来管?
Agent 上线不是交付结束。即使没有专职 AI 团队,也要把责任拆给现有业务和技术角色:业务 Owner 管规则和知识,技术支持管账号与集成,负责人看成本、价值和扩展节奏。
- 每次变更记录版本、负责人、影响范围和回滚方式。
- 每周查看失败样本、人工介入比例、调用成本和关键业务指标。
- 每月检查知识库的过期内容、访问权限和供应商/模型配置。
- 为高风险流程保留人工接管入口和清晰的反馈通道。
关于最小日常运维机制,可继续阅读Agent 日常运维怎么做?。
何时可以从试点进入扩展?
当试点在约定周期内达到通过线、责任人愿意持续维护、数据与权限边界已经可复制时,再把同一套方法扩展到第二个相邻场景。先复制“成功方式”,而不是简单复制一个聊天窗口。FFDE 的方法论会把场景、数据、系统、运营与人才作为一起验收的底座,详见AI 落地方法论。