学完能做什么
读完后,你可以不看排行榜,也不追“全能工具”,只根据任务选择合适的 AI 能力和工作方式。
你会得到:
- 一套六问选择法;
- 一张任务与工具类型的对应表;
- 三个从需求到工具组合的完整例子;
- 一份试用新工具时的验收清单。
前置知识
知道 AI 可以生成文字、图片或代码即可。不需要了解模型参数。
为什么“哪个 AI 最好”通常问错了
工具没有脱离任务的绝对排名。写一封邮件、核对五十页合同、分析一张表格、修改一个代码仓库,需要的输入、交互、验证和风险控制完全不同。
更有用的问题是:
在我的材料、交付格式、风险和预算限制下,哪种工作方式最省步骤,而且结果可以检查?
先定义任务,再选工具。工具更新时,这套方法仍然有效。
先写任务卡,不要先打开工具
把下面内容复制到笔记里。五分钟写不完,说明任务还没定义清楚:
任务名称:
使用者:谁会使用结果?
输入:材料类型、数量、所在位置、敏感级别
输出:文件类型、长度、字段、交付位置
时效:什么时候需要?信息是否必须最新?
频率:一次 / 每周 / 每天 / 实时
正确标准:怎样判断结果可用?
错误后果:低 / 中 / 高,具体会发生什么?
人工确认:哪一步必须停下来?
预算限制:单次成本和可接受总耗时选型不是选一个名字,而是为这张任务卡选择一条完整流程。
选择前先回答六个问题
1. 最后要交付什么
把结果写成可验收的名词,而不是模糊动词。
- 不清楚:帮我研究一下竞品。
- 可验收:一张包含功能、价格、限制和证据链接的对比表,以及 300 字结论。
交付物决定你需要对话、搜索、文档、表格、图片、代码还是自动化能力。
2. 输入材料在哪里
- 只有你脑中的想法:普通对话就能开始。
- 几个本地文件:选择支持文件读取和长上下文的工具。
- 大量长期资料:需要结构化整理或知识库。
- 实时网页与公开信息:需要搜索、浏览和来源记录。
- 公司内部系统:需要受控的 API 或 MCP 连接。
3. 任务是一轮完成,还是需要来回修改
- 一次性改写:单轮生成即可。
- 需要多次比较和调整:使用对话式工作区。
- 有固定步骤和判断分支:考虑工作流或 Agent。
- 会持续几天或多人协作:需要保存状态、版本和负责人。
4. 结果错了会怎样
风险越高,越不能只看生成效果。
| 风险等级 | 示例 | 必须增加的措施 |
|---|---|---|
| 低 | 头脑风暴、内部草稿 | 人工快速浏览 |
| 中 | 对外文章、数据总结 | 引用材料、事实核对、版本记录 |
| 高 | 合同、财务、医疗、生产操作 | 专业复核、权限限制、审批与审计 |
AI 可以辅助高风险任务,但不能把验证责任一起外包。
5. 任务多久重复一次
- 偶尔一次:手动操作最快。
- 每周重复:保存模板或建立 Skill。
- 每天多次:考虑自动化工作流。
- 高频且包含多步判断:评估 Agent,但先计算维护成本。
6. 数据能不能交给外部服务
先识别个人信息、客户数据、合同、密钥和未公开业务信息。再检查:
- 数据会传到哪里;
- 是否会被保存;
- 谁能访问;
- 能否删除;
- 是否可以只提供脱敏后的必要片段。
如果这些问题没有答案,先不要上传敏感材料。
任务与工具类型选择表
| 你的任务 | 优先选择 | 需要补充的能力 | 主要检查点 |
|---|---|---|---|
| 改写、总结、起草 | 对话模型 | 文件读取、固定模板 | 是否忠于原意,有无编造 |
| 查询最新公开信息 | AI 搜索或浏览 | 来源记录、日期过滤 | 证据是否直接支持结论 |
| 深度研究与对比 | 研究工作区 | 多来源整理、表格输出 | 是否遗漏反例,来源是否独立 |
| 处理文档、表格、演示 | 办公工作区 | 格式控制、脚本或公式 | 文件是否可编辑,公式是否正确 |
| 生成图片、视频、音频 | 媒体生成工具 | 参考素材、尺寸、后期编辑 | 授权、人物一致性、文字错误 |
| 修改代码仓库 | 智能编程工具 | 终端、版本控制、测试 | 改动范围、测试、密钥安全 |
| 查询个人或企业资料 | 知识库 / RAG | 权限、索引、引用定位 | 能否回到原文,权限是否隔离 |
| 重复搬运与通知 | 自动化工作流 | 触发器、API、失败重试 | 重复执行、漏发、回滚 |
| 多步判断并调用工具 | Agent | 状态、工具白名单、确认机制 | 是否失控循环,是否越权 |
用七个维度给候选方案打分
当两个工具都“看起来能做”时,用同一任务、同一材料评分。每项 0 到 2 分:
| 维度 | 0 分 | 1 分 | 2 分 |
|---|---|---|---|
| 输入适配 | 无法读取材料 | 需要大量转换 | 可直接读取并保持结构 |
| 输出可用 | 只能复制粘贴 | 可导出但要重排 | 可直接继续编辑或进入下一步 |
| 可验证 | 找不到依据 | 部分能追溯 | 每个关键结论都能定位材料 |
| 可控制 | 经常自行猜测 | 可通过提示改善 | 能限制格式、范围和动作 |
| 数据边界 | 去向不清楚 | 可关闭部分保留 | 权限、保留和删除规则明确 |
| 重复效率 | 每次从头做 | 可保存模板 | 可稳定复用并记录状态 |
| 总成本 | 验证和返工很高 | 基本可接受 | 时间、费用和维护都可控 |
不要直接相加后选最高分。先设“一票否决项”:例如包含客户隐私时,数据边界为 0 分的方案直接淘汰;要发布财务数字时,可验证为 0 分的方案也直接淘汰。
选型记录模板
候选方案 A:
候选方案 B:
测试材料:
一票否决项:
七项得分:
得到可交付结果的总时间:
仍需人工完成的步骤:
最终选择与理由:
一个月后复查条件:保留这张记录,下次工具更新时才能比较“是否真的更好”,而不是凭印象重来。
三个完整例子
例子一:把一场访谈整理成公众号草稿
交付物:一篇 1800 字草稿,包含标题、摘要、三级结构和待核实标记。 输入:访谈转写和产品资料。 频率:每月两次。 风险:不能虚构受访者观点。
合适组合:
- 用支持长文档的对话工具读取转写;
- 先提取观点与原文位置,不直接写文章;
- 按固定模板生成结构;
- 生成草稿时要求每个关键判断能回到材料;
- 人工核对引语、数字和专有名词;
- 保存提示模板即可,暂时不需要自动化 Agent。
例子二:每周整理客服问题趋势
交付物:问题分类表、数量变化、三个典型案例和下周建议。 输入:每周新增的客服记录。 频率:固定每周。 风险:包含客户信息,分类必须一致。
合适组合:
- 先在受控环境中脱敏;
- 用表格或脚本做数量统计;
- 用模型按固定分类标准处理文本;
- 对低置信度记录保留“待人工分类”;
- 把流程保存为 Skill;
- 稳定运行几周后,再用工作流自动读取和生成草稿;
- 正式发送前保留人工确认。
这里不能只用对话模型,因为统计、重复性和数据权限都很重要。
例子三:修改一个已有网站的注册流程
交付物:可以运行的代码改动、测试结果和变更说明。 输入:整个代码仓库、错误日志和设计要求。 频率:项目型任务。 风险:错误可能影响登录和用户数据。
合适组合:
- 选择能读取仓库、搜索代码和运行测试的智能编程工具;
- 先要求它定位相关文件与现有数据流;
- 明确允许修改的范围;
- 修改后运行针对性测试与完整构建;
- 用版本控制查看差异;
- 部署、数据库迁移和密钥变更必须单独确认。
普通网页对话不适合这个任务,因为它看不到完整仓库,也无法验证修改是否能运行。
什么时候需要知识库
满足下面三项中的两项,再认真考虑知识库:
- 材料很多,单次无法完整提供;
- 内容会持续更新;
- 回答必须能定位到内部原文;
- 不同人员只能看到各自权限内的资料;
- 同一批资料会被反复查询。
如果只有三份不会再更新的文档,直接上传并在当前对话中处理,通常更简单。
知识库也不是“上传文件就完成”。至少要处理资料清理、切分、索引、召回、权限和回答引用。测试时要准备一组有标准答案的问题,检查系统能不能找到正确片段,而不是只看回答是否流畅。
一个最小知识库包含六个环节
原始资料
→ 清理:去重、去广告、标记版本和权限
→ 切分:保持章节和语义完整
→ 索引:让系统能够检索
→ 召回:根据问题取回候选片段
→ 生成:只依据取回材料组织回答
→ 验证:显示出处并测试是否命中正确版本每个环节都可能失败:
- 清理失败会让重复或过期资料互相冲突;
- 切分过碎会丢失上下文,过大又可能把无关内容带进回答;
- 召回失败时,模型再聪明也拿不到正确依据;
- 权限过滤放在生成之后已经太晚,未授权内容可能已经进入模型上下文;
- 只测试“能回答的问题”,看不出系统在无答案时是否会编造。
准备至少四类测试问题:明确有答案、需要组合多个片段、资料中没有答案、当前用户无权查看。合格系统不仅要答对,也要在不能回答时说清原因。
什么时候需要自动化或 Agent
用下面的升级顺序,避免过早复杂化:
手动对话
→ 固定提示模板
→ 可复用 Skill
→ 确定步骤的自动化工作流
→ 需要动态判断和工具调用的 Agent只要上一级稳定解决问题,就不急着升级。升级的理由应该是减少重复步骤、降低遗漏或处理更多分支,而不是因为新名词更高级。
20 分钟试用法
第一次试用任何工具,不要只让它写一首诗。拿同一个真实小任务做对比:
- 准备一份无敏感信息的测试材料;
- 写清交付格式和三个验收标准;
- 记录从开始到得到可用结果的总时间;
- 故意给一个含糊信息,看它会询问还是猜测;
- 修改一次要求,看它能否保留未修改部分;
- 导出结果,检查格式是否还能继续编辑;
- 查看数据、权限和删除设置;
- 计算完成十次同类任务的成本,而不是只看单次价格。
完整实操:用同一份材料比较两种方案
准备一份 3 到 5 页、没有敏感信息的公开材料,目标是生成“一页摘要 + 五个事实问题的答案”。
第 1 轮:建立标准答案
人工写出:
- 摘要必须包含的三个结论;
- 五个问题的正确答案和原文位置;
- 两条材料中没有的信息;
- 输出必须遵守的格式。
第 2 轮:测试候选方案
分别在方案 A、B 中使用完全相同的任务说明。记录:
- 从导入材料到得到第一版的时间;
- 事实题答对数量;
- 是否对无答案问题进行猜测;
- 能否指出原文位置;
- 调整格式需要几轮;
- 导出的结果是否可继续编辑。
第 3 轮:加入一次变化
替换材料中的一个数字,再重复任务。观察工具是重新读取最新材料,还是沿用旧对话中的数字。这个测试可以暴露缓存、版本和上下文更新问题。
第 4 轮:写出结论
不要写“方案 A 更智能”,而要写成:
在 5 个事实题中 A 答对 5 个,B 答对 4 个;A 能定位原文但导出格式需要整理,B 导出更方便但对无答案问题有一次猜测。因此当前任务选择 A,并保留人工格式检查。
这样的结论才可以复用和复查。
常见错误
错误一:用功能数量代替任务匹配度
你需要的是最短的可靠流程,不是最长的功能清单。
错误二:只比较回答,不比较验证成本
一个结果看起来更漂亮,但每个数字都要重新核对,它可能反而更贵。
错误三:让 AI 同时负责生成和批准
生成、检查和执行最好分层。涉及外部发送、正式发布、支付、删除或生产变更时,必须保留独立确认。
错误四:把知识库当作永久记忆
知识库需要更新、权限、版本和召回测试。旧资料不清理,系统会稳定地找到过期答案。
错误五:频繁更换工具,却没有固定测试任务
没有同一组材料和验收标准,就无法知道变化来自工具,还是来自你的提问方式。
完成检查清单
为你最近的一个任务填写:
- 最终交付物是什么?
- 输入材料在哪里,是否包含敏感数据?
- 任务是一轮、固定步骤,还是动态多步?
- 错误结果的真实后果是什么?
- 多久重复一次?
- 最小需要哪一种工具类型?
- 哪一步由人验收?
- 什么条件出现后才值得升级为知识库、工作流或 Agent?
- 我已经设置至少一个一票否决项。
- 候选工具使用了相同材料和相同验收标准。
- 我记录的是得到可交付结果的总时间,而不是模型首次回答速度。
交付物:一页选型说明
完成本篇后,你应该留下一个真正能用的文件,而不是只读完文章:
# 任务选型说明
## 任务卡
输入、输出、时效、频率、风险、确认点
## 候选方案
各自流程与七维评分
## 小规模测试
材料、标准答案、结果、耗时
## 决定
为什么选择、人工检查点、放弃方案的原因
## 复查
何时重新评估,什么变化会触发升级下一篇
《对话、搜索、研究与长文分别怎么选》——用同一个问题,比较四种工作方式的输入、证据和交付差异。