AI 工具与知识库 · 第 1 篇

先看任务,再选工具

先按输入、过程和交付物拆任务,再决定是否需要搜索、知识库或自动化。

28 分钟工具入门

学完能做什么

读完后,你可以不看排行榜,也不追“全能工具”,只根据任务选择合适的 AI 能力和工作方式。

你会得到:

  • 一套六问选择法;
  • 一张任务与工具类型的对应表;
  • 三个从需求到工具组合的完整例子;
  • 一份试用新工具时的验收清单。

前置知识

知道 AI 可以生成文字、图片或代码即可。不需要了解模型参数。

为什么“哪个 AI 最好”通常问错了

工具没有脱离任务的绝对排名。写一封邮件、核对五十页合同、分析一张表格、修改一个代码仓库,需要的输入、交互、验证和风险控制完全不同。

更有用的问题是:

在我的材料、交付格式、风险和预算限制下,哪种工作方式最省步骤,而且结果可以检查?

先定义任务,再选工具。工具更新时,这套方法仍然有效。

先写任务卡,不要先打开工具

把下面内容复制到笔记里。五分钟写不完,说明任务还没定义清楚:

text
任务名称:
使用者:谁会使用结果?
输入:材料类型、数量、所在位置、敏感级别
输出:文件类型、长度、字段、交付位置
时效:什么时候需要?信息是否必须最新?
频率:一次 / 每周 / 每天 / 实时
正确标准:怎样判断结果可用?
错误后果:低 / 中 / 高,具体会发生什么?
人工确认:哪一步必须停下来?
预算限制:单次成本和可接受总耗时

选型不是选一个名字,而是为这张任务卡选择一条完整流程。

选择前先回答六个问题

1. 最后要交付什么

把结果写成可验收的名词,而不是模糊动词。

  • 不清楚:帮我研究一下竞品。
  • 可验收:一张包含功能、价格、限制和证据链接的对比表,以及 300 字结论。

交付物决定你需要对话、搜索、文档、表格、图片、代码还是自动化能力。

2. 输入材料在哪里

  • 只有你脑中的想法:普通对话就能开始。
  • 几个本地文件:选择支持文件读取和长上下文的工具。
  • 大量长期资料:需要结构化整理或知识库。
  • 实时网页与公开信息:需要搜索、浏览和来源记录。
  • 公司内部系统:需要受控的 API 或 MCP 连接。

3. 任务是一轮完成,还是需要来回修改

  • 一次性改写:单轮生成即可。
  • 需要多次比较和调整:使用对话式工作区。
  • 有固定步骤和判断分支:考虑工作流或 Agent。
  • 会持续几天或多人协作:需要保存状态、版本和负责人。

4. 结果错了会怎样

风险越高,越不能只看生成效果。

风险等级示例必须增加的措施
头脑风暴、内部草稿人工快速浏览
对外文章、数据总结引用材料、事实核对、版本记录
合同、财务、医疗、生产操作专业复核、权限限制、审批与审计

AI 可以辅助高风险任务,但不能把验证责任一起外包。

5. 任务多久重复一次

  • 偶尔一次:手动操作最快。
  • 每周重复:保存模板或建立 Skill。
  • 每天多次:考虑自动化工作流。
  • 高频且包含多步判断:评估 Agent,但先计算维护成本。

6. 数据能不能交给外部服务

先识别个人信息、客户数据、合同、密钥和未公开业务信息。再检查:

  • 数据会传到哪里;
  • 是否会被保存;
  • 谁能访问;
  • 能否删除;
  • 是否可以只提供脱敏后的必要片段。

如果这些问题没有答案,先不要上传敏感材料。

任务与工具类型选择表

你的任务优先选择需要补充的能力主要检查点
改写、总结、起草对话模型文件读取、固定模板是否忠于原意,有无编造
查询最新公开信息AI 搜索或浏览来源记录、日期过滤证据是否直接支持结论
深度研究与对比研究工作区多来源整理、表格输出是否遗漏反例,来源是否独立
处理文档、表格、演示办公工作区格式控制、脚本或公式文件是否可编辑,公式是否正确
生成图片、视频、音频媒体生成工具参考素材、尺寸、后期编辑授权、人物一致性、文字错误
修改代码仓库智能编程工具终端、版本控制、测试改动范围、测试、密钥安全
查询个人或企业资料知识库 / RAG权限、索引、引用定位能否回到原文,权限是否隔离
重复搬运与通知自动化工作流触发器、API、失败重试重复执行、漏发、回滚
多步判断并调用工具Agent状态、工具白名单、确认机制是否失控循环,是否越权

用七个维度给候选方案打分

当两个工具都“看起来能做”时,用同一任务、同一材料评分。每项 0 到 2 分:

维度0 分1 分2 分
输入适配无法读取材料需要大量转换可直接读取并保持结构
输出可用只能复制粘贴可导出但要重排可直接继续编辑或进入下一步
可验证找不到依据部分能追溯每个关键结论都能定位材料
可控制经常自行猜测可通过提示改善能限制格式、范围和动作
数据边界去向不清楚可关闭部分保留权限、保留和删除规则明确
重复效率每次从头做可保存模板可稳定复用并记录状态
总成本验证和返工很高基本可接受时间、费用和维护都可控

不要直接相加后选最高分。先设“一票否决项”:例如包含客户隐私时,数据边界为 0 分的方案直接淘汰;要发布财务数字时,可验证为 0 分的方案也直接淘汰。

选型记录模板

text
候选方案 A:
候选方案 B:
测试材料:
一票否决项:
七项得分:
得到可交付结果的总时间:
仍需人工完成的步骤:
最终选择与理由:
一个月后复查条件:

保留这张记录,下次工具更新时才能比较“是否真的更好”,而不是凭印象重来。

三个完整例子

例子一:把一场访谈整理成公众号草稿

交付物:一篇 1800 字草稿,包含标题、摘要、三级结构和待核实标记。 输入:访谈转写和产品资料。 频率:每月两次。 风险:不能虚构受访者观点。

合适组合:

  1. 用支持长文档的对话工具读取转写;
  2. 先提取观点与原文位置,不直接写文章;
  3. 按固定模板生成结构;
  4. 生成草稿时要求每个关键判断能回到材料;
  5. 人工核对引语、数字和专有名词;
  6. 保存提示模板即可,暂时不需要自动化 Agent。

例子二:每周整理客服问题趋势

交付物:问题分类表、数量变化、三个典型案例和下周建议。 输入:每周新增的客服记录。 频率:固定每周。 风险:包含客户信息,分类必须一致。

合适组合:

  1. 先在受控环境中脱敏;
  2. 用表格或脚本做数量统计;
  3. 用模型按固定分类标准处理文本;
  4. 对低置信度记录保留“待人工分类”;
  5. 把流程保存为 Skill;
  6. 稳定运行几周后,再用工作流自动读取和生成草稿;
  7. 正式发送前保留人工确认。

这里不能只用对话模型,因为统计、重复性和数据权限都很重要。

例子三:修改一个已有网站的注册流程

交付物:可以运行的代码改动、测试结果和变更说明。 输入:整个代码仓库、错误日志和设计要求。 频率:项目型任务。 风险:错误可能影响登录和用户数据。

合适组合:

  1. 选择能读取仓库、搜索代码和运行测试的智能编程工具;
  2. 先要求它定位相关文件与现有数据流;
  3. 明确允许修改的范围;
  4. 修改后运行针对性测试与完整构建;
  5. 用版本控制查看差异;
  6. 部署、数据库迁移和密钥变更必须单独确认。

普通网页对话不适合这个任务,因为它看不到完整仓库,也无法验证修改是否能运行。

什么时候需要知识库

满足下面三项中的两项,再认真考虑知识库:

  • 材料很多,单次无法完整提供;
  • 内容会持续更新;
  • 回答必须能定位到内部原文;
  • 不同人员只能看到各自权限内的资料;
  • 同一批资料会被反复查询。

如果只有三份不会再更新的文档,直接上传并在当前对话中处理,通常更简单。

知识库也不是“上传文件就完成”。至少要处理资料清理、切分、索引、召回、权限和回答引用。测试时要准备一组有标准答案的问题,检查系统能不能找到正确片段,而不是只看回答是否流畅。

一个最小知识库包含六个环节

text
原始资料
  → 清理:去重、去广告、标记版本和权限
  → 切分:保持章节和语义完整
  → 索引:让系统能够检索
  → 召回:根据问题取回候选片段
  → 生成:只依据取回材料组织回答
  → 验证:显示出处并测试是否命中正确版本

每个环节都可能失败:

  • 清理失败会让重复或过期资料互相冲突;
  • 切分过碎会丢失上下文,过大又可能把无关内容带进回答;
  • 召回失败时,模型再聪明也拿不到正确依据;
  • 权限过滤放在生成之后已经太晚,未授权内容可能已经进入模型上下文;
  • 只测试“能回答的问题”,看不出系统在无答案时是否会编造。

准备至少四类测试问题:明确有答案、需要组合多个片段、资料中没有答案、当前用户无权查看。合格系统不仅要答对,也要在不能回答时说清原因。

什么时候需要自动化或 Agent

用下面的升级顺序,避免过早复杂化:

text
手动对话
  → 固定提示模板
  → 可复用 Skill
  → 确定步骤的自动化工作流
  → 需要动态判断和工具调用的 Agent

只要上一级稳定解决问题,就不急着升级。升级的理由应该是减少重复步骤、降低遗漏或处理更多分支,而不是因为新名词更高级。

20 分钟试用法

第一次试用任何工具,不要只让它写一首诗。拿同一个真实小任务做对比:

  1. 准备一份无敏感信息的测试材料;
  2. 写清交付格式和三个验收标准;
  3. 记录从开始到得到可用结果的总时间;
  4. 故意给一个含糊信息,看它会询问还是猜测;
  5. 修改一次要求,看它能否保留未修改部分;
  6. 导出结果,检查格式是否还能继续编辑;
  7. 查看数据、权限和删除设置;
  8. 计算完成十次同类任务的成本,而不是只看单次价格。

完整实操:用同一份材料比较两种方案

准备一份 3 到 5 页、没有敏感信息的公开材料,目标是生成“一页摘要 + 五个事实问题的答案”。

第 1 轮:建立标准答案

人工写出:

  • 摘要必须包含的三个结论;
  • 五个问题的正确答案和原文位置;
  • 两条材料中没有的信息;
  • 输出必须遵守的格式。

第 2 轮:测试候选方案

分别在方案 A、B 中使用完全相同的任务说明。记录:

  • 从导入材料到得到第一版的时间;
  • 事实题答对数量;
  • 是否对无答案问题进行猜测;
  • 能否指出原文位置;
  • 调整格式需要几轮;
  • 导出的结果是否可继续编辑。

第 3 轮:加入一次变化

替换材料中的一个数字,再重复任务。观察工具是重新读取最新材料,还是沿用旧对话中的数字。这个测试可以暴露缓存、版本和上下文更新问题。

第 4 轮:写出结论

不要写“方案 A 更智能”,而要写成:

在 5 个事实题中 A 答对 5 个,B 答对 4 个;A 能定位原文但导出格式需要整理,B 导出更方便但对无答案问题有一次猜测。因此当前任务选择 A,并保留人工格式检查。

这样的结论才可以复用和复查。

常见错误

错误一:用功能数量代替任务匹配度

你需要的是最短的可靠流程,不是最长的功能清单。

错误二:只比较回答,不比较验证成本

一个结果看起来更漂亮,但每个数字都要重新核对,它可能反而更贵。

错误三:让 AI 同时负责生成和批准

生成、检查和执行最好分层。涉及外部发送、正式发布、支付、删除或生产变更时,必须保留独立确认。

错误四:把知识库当作永久记忆

知识库需要更新、权限、版本和召回测试。旧资料不清理,系统会稳定地找到过期答案。

错误五:频繁更换工具,却没有固定测试任务

没有同一组材料和验收标准,就无法知道变化来自工具,还是来自你的提问方式。

完成检查清单

为你最近的一个任务填写:

  • 最终交付物是什么?
  • 输入材料在哪里,是否包含敏感数据?
  • 任务是一轮、固定步骤,还是动态多步?
  • 错误结果的真实后果是什么?
  • 多久重复一次?
  • 最小需要哪一种工具类型?
  • 哪一步由人验收?
  • 什么条件出现后才值得升级为知识库、工作流或 Agent?
  • 我已经设置至少一个一票否决项。
  • 候选工具使用了相同材料和相同验收标准。
  • 我记录的是得到可交付结果的总时间,而不是模型首次回答速度。

交付物:一页选型说明

完成本篇后,你应该留下一个真正能用的文件,而不是只读完文章:

text
# 任务选型说明

## 任务卡
输入、输出、时效、频率、风险、确认点

## 候选方案
各自流程与七维评分

## 小规模测试
材料、标准答案、结果、耗时

## 决定
为什么选择、人工检查点、放弃方案的原因

## 复查
何时重新评估,什么变化会触发升级

下一篇

《对话、搜索、研究与长文分别怎么选》——用同一个问题,比较四种工作方式的输入、证据和交付差异。