跳到正文

课外阅读:一章看懂 AI 工作系统

本章是全白皮书的"概念底座"。不涉及任何操作,只讲清楚一件事:当你命令我干活时,背后到底发生了什么? 读懂这一章,你会从"会用 AI"进化到"理解 AI"——知道它强在哪、弱在哪、为什么会说错、怎样才能让它更可靠。

1. 先看全景:一次 AI 任务里发生了什么

当我执行你的任务时,背后其实是一套流水线在协同工作:

你的话 → 大语言模型理解(LLM)→ 分解成步骤(Agent)
       → 调用工具执行(Tool)→ 读取资料(RAG/记忆)
       → 按方法做事(Skill)→ 返回结果给你

每个名词都是这套流水线上的一个齿轮。下面逐个拆开。

2. LLM:会"接话"的预测引擎

LLM(Large Language Model,大语言模型) 是我大脑的核心,一个经过海量文本训练、擅长"根据上下文预测下一个内容"的模型。

2.1 它擅长什么

  • 理解自然语言(中文、英文、代码都能读);
  • 生成连贯、有条理的文本(写文档、写代码、总结);
  • 推理和规划(拆步骤、做比较、找逻辑)。

2.2 它不天然保证什么

不保证说明
事实准确它擅长"像那么回事",不擅长"确实如此"可能一本正经说错数据
逻辑完备长链条推理会丢步骤10 步逻辑可能漏 1 步
立场中立受训练数据和你的引导影响会顺着你的暗示说

2.3 为什么会有"幻觉"

LLM 的机制是"预测最可能的下一句",不是"查证事实"。当它不知道答案时,最自然的做法是"编一个看起来对的"——这就是幻觉。

降低幻觉的四个办法:

办法原理例子
给资料让它"读着答"而不是"凭记忆答"把文档给它读
要引用强制它给出处"数据必须引用你读的文件"
拆小步长推理切成短推理先分析再下结论
交叉验证多个来源/多问一遍让它复述+自查

3. Token 与上下文窗口:AI 的"注意力"

3.1 Token 是什么

模型处理文本的最小单位,一个中文词通常约等于 1~2 个 token。你发给我的所有内容(包括我读的文件、写的结果)都会换算成 token 来消耗"脑力"。

3.2 上下文窗口:一次能"记住"多少

每个模型有上下文窗口上限——一次任务里能同时看到的内容总量。超出部分,就"看不过来了"。

这对你的实践意味着什么:

实践原因
长文档别一次全塞会被截断/遗忘
关键信息放前面或明确强调窗口中间的内容最容易被忽略
文件大就分段处理别让上下文爆掉

3.3 上下文是"资源",不是"无限内存"

text
你:"读一下这本 500 页的书,然后写总结"
我:(打开书)→ 发现超出上下文窗口 → 正确做法:
    分段读 → 每段提取要点 → 汇总要点成总结

记住:我是"分段工作"的,不是"全书速记"的。 这正是为什么白皮书里反复强调"给输入、给文件、给路径"——你给的材料,我用工具去读;读不下的,我分段读。

4. Prompt:你下的"任务指令"

Prompt(提示词)就是你对我说的话——任务指令。它决定了我的工作方向。

4.1 为什么同一件事,说法不同结果天差地别

❌ "弄一下这个数据"
✅ "阅读 data/sales.csv,按渠道和月份汇总销售额,输出表格,并指出异常"

Prompt 质量 = 信息完整度。 你给的约束越多(目标/输入/格式/验收),我猜的成分越少。

4.2 好 Prompt 的六个要素

要素问自己
角色我以什么身份做?(分析师?编辑?)
任务到底要什么结果?
输入资料在哪?给路径/内容
格式输出成什么样?(表格/清单/文档)
约束有什么限制?(长度/语言/风格)
验收怎么算完成?

(完整模板见正文第 2 章与附录 A。)

5. Agent:能"自主行动"的执行体

Agent(智能体) 是 LLM 的"行动版"——不仅会说话,还能围绕目标循环行动

理解目标 → 制定计划 → 调用工具执行 → 检查结果 → 调整 → 继续

5.1 Agent 与普通聊天的区别

普通聊天Agent
输出文字建议实际动作
循环一问一答计划→执行→检查→调整
工具读写文件、执行命令
例子"你应该整理这个目录""我已经把目录整理好了"

5.2 Agent 的核心循环

目标 → 计划 → 行动(调工具)→ 观察结果 → 反思 → 下一轮行动

这个循环就是我在白皮书第 1 章讲的"五步协作循环"的技术本质。你看到的"我干活",就是这个循环在高速运转。

5.3 Agent 的局限

  • 过度自信:会高估自己完成得有多好;
  • 目标偏离:长期任务会慢慢跑偏(所以要中间检查);
  • 上下文有限:记住的东西随长度衰减(所以要留档、要记忆)。

6. Tool:让 AI 真的能"动手"

Tool(工具) 是 Agent 的"手和脚"——读写文件、执行命令、搜索内容、运行脚本的能力。没有工具,Agent 只能"说";有了工具,Agent 能"做"。

6.1 每个工具都要问的五件事

一个合格的工具,应该回答:

  1. 它干什么?(功能)
  2. 什么时候用?(触发条件)
  3. 输入是什么?(参数)
  4. 输出是什么?(结果)
  5. 边界在哪?(不能干什么/有什么风险)

(我身上的工具清单,见正文第 3 章。)

6.2 工具为什么重要

工具是 AI 从"建议者"到"执行者"的分水岭。

没有工具:AI 说"你应该用 Python 写个脚本"
有工具:  AI 已经用 Python 把脚本写好了,还跑通了

7. Skill:封装"专业工作法"

Skill(技能) 是把"做一件事的最佳实践"封装成可调用的方法——不仅会做,而且按规定的好方法做。

7.1 Skill 与普通指令的区别

普通指令:每次都要重新交代怎么做
Skill:一句话触发,自动按最佳实践执行

7.2 Skill 的标准结构

  • 用途:什么时候用它;
  • 触发:说什么话会触发;
  • 步骤:按顺序的执行动作;
  • 边界:什么情况下不能用。

(如何打造自己的 Skill,见正文第 17 章。)

8. MCP:AI 世界的"标准插座"

MCP(Model Context Protocol,模型上下文协议) 是让 AI 与外部系统连接的标准化接口——好比电脑的 USB 接口:不管什么设备,只要支持 USB 标准,插上就能用。

8.1 MCP 解决什么问题

没有 MCP:每个工具都要单独定制连接方式,麻烦、易错
有 MCP:统一的接口标准,工具即插即用

8.2 MCP 与 API 的关系

API:一种连接方式(A 系统的接口)
MCP:统一了"AI 怎么发现、怎么调用"这些接口的标准

类比:API 是插座,MCP 是"统一的插座标准"。

9. RAG 与记忆:AI 的"外挂资料库"

9.1 为什么需要"外挂"

LLM 的训练数据有截止时间,也不包含你的私有资料。所以要让 AI 了解"你的世界",需要检索增强生成(RAG,Retrieval-Augmented Generation):先检索相关资料,再基于资料回答。

9.2 RAG 的工作方式

你的问题 → 检索相关资料(从你的文档/知识库)→ 把资料+问题一起给 LLM → 基于资料回答

效果:AI 不再"凭记忆瞎说",而是"读了你的资料再说话"——这就是我读你给的文件、搜索你的代码库时在做的事。

9.3 记忆 vs RAG

RAG(检索增强)记忆(Memory)
存什么你的文档、知识库你的偏好、决策、上下文
作用回答问题时有依据协作时懂你
例子"根据项目文档回答……""用户偏好中文简洁"

两者结合:RAG 让我"知道得多",记忆让我"懂你深"。

10. Workflow 与 Agent:两条不同的路

这是最容易混淆的一对概念:

10.1 Workflow:预定义的流水线

步骤写死:A → B → C → D(每一步是什么都提前定好)
特点:可预测、稳定、适合流程固定的任务

10.2 Agent:自主决策的执行体

AI 自己决定:先做什么、后做什么、怎么调整
特点:灵活、适应变化,但结果不那么可预测

10.3 对比表

维度WorkflowAgent
步骤预先定义自主决定
可预测性
灵活性
适合流程固定、重复任务复杂多变、需要判断
类比工厂流水线独立顾问

10.4 何时用哪个

流程固定、重复执行 → Workflow(第 15 章自动化)
复杂多变、需要判断 → Agent(第 18 章多 Agent 系统)
最佳实践:Workflow 负责固定环节,Agent 负责判断环节

11. 一张图总结:AI 工作系统的全貌

┌─────────────────────────────────────────┐
│  你(提出目标,检查结果)                  │
│        ↓  Prompt(任务指令)              │
│  ┌── LLM(理解与生成的大脑)─────────┐    │
│  │    ↓ 目标理解                       │    │
│  │  Agent(自主行动的执行体)          │    │
│  │    ↓ 循环:计划→行动→检查→调整      │    │
│  │  Tool(手和脚:读写/命令/搜索)      │    │
│  │  Skill(专业方法:按最佳实践做)      │    │
│  │  RAG/记忆(外挂资料:懂你+有依据)   │    │
│  └─────────────────────────────────────┘    │
│        ↓  MCP(标准接口连接外部系统)        │
│  外部世界(文件、命令、服务、团队)           │
└─────────────────────────────────────────┘

12. 这些概念如何对应你的日常

你做的事背后的概念对应章节
把需求讲清楚Prompt 质量第 2 章
我读你的文件RAG第 3 章
我用工具干活Tool + Agent第 3 章
调用专业技能Skill第 5、17 章
我记住你的偏好记忆系统第 6、20 章
自动跑流程Workflow第 15 章
开 AI 团队多 Agent 系统第 8、18 章

13. 阅读建议

  • 不打算深究原理:记住三句话就够了——① LLM 会"像那么回事"地说,不一定准;② 给资料、要引用、拆小步,能显著减少幻觉;③ 我干活靠的是"工具+方法+资料",所以你要给我输入和验收标准。
  • 想彻底搞懂:按顺序重读第 2、3、5、7 节,再回到正文边用边理解。
  • 以后遇到新概念:随时问我,我可以结合你的场景解释。

课外阅读的定位:"理解层"的内容,不需要记住,需要建立直觉。 当你看到"幻觉""上下文""Agent"这些词不再发怵,这一章的目的就达到了。

以真实任务为主线的 MomaWork 助手实战读本