外观
课外阅读:一章看懂 AI 工作系统
本章是全白皮书的"概念底座"。不涉及任何操作,只讲清楚一件事:当你命令我干活时,背后到底发生了什么? 读懂这一章,你会从"会用 AI"进化到"理解 AI"——知道它强在哪、弱在哪、为什么会说错、怎样才能让它更可靠。
1. 先看全景:一次 AI 任务里发生了什么
当我执行你的任务时,背后其实是一套流水线在协同工作:
你的话 → 大语言模型理解(LLM)→ 分解成步骤(Agent)
→ 调用工具执行(Tool)→ 读取资料(RAG/记忆)
→ 按方法做事(Skill)→ 返回结果给你每个名词都是这套流水线上的一个齿轮。下面逐个拆开。
2. LLM:会"接话"的预测引擎
LLM(Large Language Model,大语言模型) 是我大脑的核心,一个经过海量文本训练、擅长"根据上下文预测下一个内容"的模型。
2.1 它擅长什么
- 理解自然语言(中文、英文、代码都能读);
- 生成连贯、有条理的文本(写文档、写代码、总结);
- 推理和规划(拆步骤、做比较、找逻辑)。
2.2 它不天然保证什么
| 不保证 | 说明 | 例 |
|---|---|---|
| 事实准确 | 它擅长"像那么回事",不擅长"确实如此" | 可能一本正经说错数据 |
| 逻辑完备 | 长链条推理会丢步骤 | 10 步逻辑可能漏 1 步 |
| 立场中立 | 受训练数据和你的引导影响 | 会顺着你的暗示说 |
2.3 为什么会有"幻觉"
LLM 的机制是"预测最可能的下一句",不是"查证事实"。当它不知道答案时,最自然的做法是"编一个看起来对的"——这就是幻觉。
降低幻觉的四个办法:
| 办法 | 原理 | 例子 |
|---|---|---|
| 给资料 | 让它"读着答"而不是"凭记忆答" | 把文档给它读 |
| 要引用 | 强制它给出处 | "数据必须引用你读的文件" |
| 拆小步 | 长推理切成短推理 | 先分析再下结论 |
| 交叉验证 | 多个来源/多问一遍 | 让它复述+自查 |
3. Token 与上下文窗口:AI 的"注意力"
3.1 Token 是什么
模型处理文本的最小单位,一个中文词通常约等于 1~2 个 token。你发给我的所有内容(包括我读的文件、写的结果)都会换算成 token 来消耗"脑力"。
3.2 上下文窗口:一次能"记住"多少
每个模型有上下文窗口上限——一次任务里能同时看到的内容总量。超出部分,就"看不过来了"。
这对你的实践意味着什么:
| 实践 | 原因 |
|---|---|
| 长文档别一次全塞 | 会被截断/遗忘 |
| 关键信息放前面或明确强调 | 窗口中间的内容最容易被忽略 |
| 文件大就分段处理 | 别让上下文爆掉 |
3.3 上下文是"资源",不是"无限内存"
text
你:"读一下这本 500 页的书,然后写总结"
我:(打开书)→ 发现超出上下文窗口 → 正确做法:
分段读 → 每段提取要点 → 汇总要点成总结记住:我是"分段工作"的,不是"全书速记"的。 这正是为什么白皮书里反复强调"给输入、给文件、给路径"——你给的材料,我用工具去读;读不下的,我分段读。
4. Prompt:你下的"任务指令"
Prompt(提示词)就是你对我说的话——任务指令。它决定了我的工作方向。
4.1 为什么同一件事,说法不同结果天差地别
❌ "弄一下这个数据"
✅ "阅读 data/sales.csv,按渠道和月份汇总销售额,输出表格,并指出异常"Prompt 质量 = 信息完整度。 你给的约束越多(目标/输入/格式/验收),我猜的成分越少。
4.2 好 Prompt 的六个要素
| 要素 | 问自己 |
|---|---|
| 角色 | 我以什么身份做?(分析师?编辑?) |
| 任务 | 到底要什么结果? |
| 输入 | 资料在哪?给路径/内容 |
| 格式 | 输出成什么样?(表格/清单/文档) |
| 约束 | 有什么限制?(长度/语言/风格) |
| 验收 | 怎么算完成? |
(完整模板见正文第 2 章与附录 A。)
5. Agent:能"自主行动"的执行体
Agent(智能体) 是 LLM 的"行动版"——不仅会说话,还能围绕目标循环行动:
理解目标 → 制定计划 → 调用工具执行 → 检查结果 → 调整 → 继续5.1 Agent 与普通聊天的区别
| 普通聊天 | Agent | |
|---|---|---|
| 输出 | 文字建议 | 实际动作 |
| 循环 | 一问一答 | 计划→执行→检查→调整 |
| 工具 | 无 | 读写文件、执行命令 |
| 例子 | "你应该整理这个目录" | "我已经把目录整理好了" |
5.2 Agent 的核心循环
目标 → 计划 → 行动(调工具)→ 观察结果 → 反思 → 下一轮行动这个循环就是我在白皮书第 1 章讲的"五步协作循环"的技术本质。你看到的"我干活",就是这个循环在高速运转。
5.3 Agent 的局限
- 过度自信:会高估自己完成得有多好;
- 目标偏离:长期任务会慢慢跑偏(所以要中间检查);
- 上下文有限:记住的东西随长度衰减(所以要留档、要记忆)。
6. Tool:让 AI 真的能"动手"
Tool(工具) 是 Agent 的"手和脚"——读写文件、执行命令、搜索内容、运行脚本的能力。没有工具,Agent 只能"说";有了工具,Agent 能"做"。
6.1 每个工具都要问的五件事
一个合格的工具,应该回答:
- 它干什么?(功能)
- 什么时候用?(触发条件)
- 输入是什么?(参数)
- 输出是什么?(结果)
- 边界在哪?(不能干什么/有什么风险)
(我身上的工具清单,见正文第 3 章。)
6.2 工具为什么重要
工具是 AI 从"建议者"到"执行者"的分水岭。
没有工具:AI 说"你应该用 Python 写个脚本"
有工具: AI 已经用 Python 把脚本写好了,还跑通了7. Skill:封装"专业工作法"
Skill(技能) 是把"做一件事的最佳实践"封装成可调用的方法——不仅会做,而且按规定的好方法做。
7.1 Skill 与普通指令的区别
普通指令:每次都要重新交代怎么做
Skill:一句话触发,自动按最佳实践执行7.2 Skill 的标准结构
- 用途:什么时候用它;
- 触发:说什么话会触发;
- 步骤:按顺序的执行动作;
- 边界:什么情况下不能用。
(如何打造自己的 Skill,见正文第 17 章。)
8. MCP:AI 世界的"标准插座"
MCP(Model Context Protocol,模型上下文协议) 是让 AI 与外部系统连接的标准化接口——好比电脑的 USB 接口:不管什么设备,只要支持 USB 标准,插上就能用。
8.1 MCP 解决什么问题
没有 MCP:每个工具都要单独定制连接方式,麻烦、易错
有 MCP:统一的接口标准,工具即插即用8.2 MCP 与 API 的关系
API:一种连接方式(A 系统的接口)
MCP:统一了"AI 怎么发现、怎么调用"这些接口的标准类比:API 是插座,MCP 是"统一的插座标准"。
9. RAG 与记忆:AI 的"外挂资料库"
9.1 为什么需要"外挂"
LLM 的训练数据有截止时间,也不包含你的私有资料。所以要让 AI 了解"你的世界",需要检索增强生成(RAG,Retrieval-Augmented Generation):先检索相关资料,再基于资料回答。
9.2 RAG 的工作方式
你的问题 → 检索相关资料(从你的文档/知识库)→ 把资料+问题一起给 LLM → 基于资料回答效果:AI 不再"凭记忆瞎说",而是"读了你的资料再说话"——这就是我读你给的文件、搜索你的代码库时在做的事。
9.3 记忆 vs RAG
| RAG(检索增强) | 记忆(Memory) | |
|---|---|---|
| 存什么 | 你的文档、知识库 | 你的偏好、决策、上下文 |
| 作用 | 回答问题时有依据 | 协作时懂你 |
| 例子 | "根据项目文档回答……" | "用户偏好中文简洁" |
两者结合:RAG 让我"知道得多",记忆让我"懂你深"。
10. Workflow 与 Agent:两条不同的路
这是最容易混淆的一对概念:
10.1 Workflow:预定义的流水线
步骤写死:A → B → C → D(每一步是什么都提前定好)
特点:可预测、稳定、适合流程固定的任务10.2 Agent:自主决策的执行体
AI 自己决定:先做什么、后做什么、怎么调整
特点:灵活、适应变化,但结果不那么可预测10.3 对比表
| 维度 | Workflow | Agent |
|---|---|---|
| 步骤 | 预先定义 | 自主决定 |
| 可预测性 | 高 | 低 |
| 灵活性 | 低 | 高 |
| 适合 | 流程固定、重复任务 | 复杂多变、需要判断 |
| 类比 | 工厂流水线 | 独立顾问 |
10.4 何时用哪个
流程固定、重复执行 → Workflow(第 15 章自动化)
复杂多变、需要判断 → Agent(第 18 章多 Agent 系统)
最佳实践:Workflow 负责固定环节,Agent 负责判断环节11. 一张图总结:AI 工作系统的全貌
┌─────────────────────────────────────────┐
│ 你(提出目标,检查结果) │
│ ↓ Prompt(任务指令) │
│ ┌── LLM(理解与生成的大脑)─────────┐ │
│ │ ↓ 目标理解 │ │
│ │ Agent(自主行动的执行体) │ │
│ │ ↓ 循环:计划→行动→检查→调整 │ │
│ │ Tool(手和脚:读写/命令/搜索) │ │
│ │ Skill(专业方法:按最佳实践做) │ │
│ │ RAG/记忆(外挂资料:懂你+有依据) │ │
│ └─────────────────────────────────────┘ │
│ ↓ MCP(标准接口连接外部系统) │
│ 外部世界(文件、命令、服务、团队) │
└─────────────────────────────────────────┘12. 这些概念如何对应你的日常
| 你做的事 | 背后的概念 | 对应章节 |
|---|---|---|
| 把需求讲清楚 | Prompt 质量 | 第 2 章 |
| 我读你的文件 | RAG | 第 3 章 |
| 我用工具干活 | Tool + Agent | 第 3 章 |
| 调用专业技能 | Skill | 第 5、17 章 |
| 我记住你的偏好 | 记忆系统 | 第 6、20 章 |
| 自动跑流程 | Workflow | 第 15 章 |
| 开 AI 团队 | 多 Agent 系统 | 第 8、18 章 |
13. 阅读建议
- 不打算深究原理:记住三句话就够了——① LLM 会"像那么回事"地说,不一定准;② 给资料、要引用、拆小步,能显著减少幻觉;③ 我干活靠的是"工具+方法+资料",所以你要给我输入和验收标准。
- 想彻底搞懂:按顺序重读第 2、3、5、7 节,再回到正文边用边理解。
- 以后遇到新概念:随时问我,我可以结合你的场景解释。
课外阅读的定位:"理解层"的内容,不需要记住,需要建立直觉。 当你看到"幻觉""上下文""Agent"这些词不再发怵,这一章的目的就达到了。