ZHONG WEI的博客

系统外观
© ZHONG WEI 2026
All rights reserved
ZHONG WEI的博客

近年 AI 应用技术串讲|从 Transformer 到 Agent、Skill、Harness

2026年8月3日
阅读评论

这两年 AI 应用层的新词冒得太快,很多概念是层层叠加出来的——不按顺序看容易糊成一团。这里按演进顺序串一遍,每节先用两三句说清是什么,再附原始论文和官方文档。


1. LLM

Transformer 架构的提出奠定了大模型时代的基础,使基于注意力机制的生成模型成为主流。目前最主流的是 Decoder-Only(仅解码器)的 Transformer 架构变体。

大模型演进树

2. Prompt Engineering(提示词工程)

提示词是用来引导模型按特定意图生成输出的输入指令,主要分「系统提示词」和「用户提示词」。

提示词工程通过设计和优化提示词,让模型更准确、可控地产出所需结果。它不改变模型的参数,是一种低成本调优手段——这也是它和微调的本质区别。

3. Fine-tuning(微调)

在已有模型基础上用特定数据再训练,让模型更适合某个具体任务或场景。

和提示词工程相反,微调要动模型参数。LoRA 的思路是只训练少量低秩参数,把训练成本大幅降下来。

4. RAG(检索增强生成)

先从外部知识库检索相关信息,再结合这些信息一起生成回答,以此提升准确性和知识时效性。

5. Function Calling(函数调用)

让模型按约定格式输出调用指令,再由外部系统真正去执行具体操作。

这一步的意义是:模型从「只会说话」变成「会调用工具」。

6. MCP(Model Context Protocol)

一种标准化协议,让模型以统一方式连接外部工具、数据源和服务,获取上下文并执行操作。

MCP 最重要的贡献之一是让工具可以跨 AI 应用复用,从而推动社区生态。在它之前,每个应用的工具接入方式都是各写各的。

7. Agent

能基于目标进行「思考 → 行动 → 观察」循环、自主调用工具完成复杂任务的智能系统。

Agent 本质上是对人类工作方式的模拟。最简形态就是「提示词 + LLM + Tools」。

8. Multi-Agent

由多个分工协作的 Agent 共同完成任务,通过拆分任务与隔离上下文来解决单 Agent 难以处理的复杂问题。

需要谨慎使用——Token 消耗大、协作效率低、系统复杂度高都是现实代价。不是所有任务都值得上多智能体。

9. Context Engineering(上下文工程)

Agent 运行时需要提供给 LLM 的一切相关信息——对话历史、用户输入、背景知识、工具结果——都是上下文。

上下文工程关注如何筛选、压缩和组织上下文,从而最大化模型的决策与推理能力。可以理解为提示词工程在 Agent 时代的延伸:要管的不再只是一段提示词,而是整个信息流。

10. Agent Skill

一种轻量级开放格式,把一整套 Agent 能力(提示词、工具脚本、知识文件等)封装成可复用模块,实现低门槛分享与复用。

几个要点:

11. OpenClaw

开源、高可扩展的 AI Agent 框架,基于 TypeScript 开发,核心用途是构建可自定义的私人 AI 助手。创新之一是拓展了 Agent 的交互入口(飞书等)。

  • OpenClaw 源码量很大,想快速理解可以先看精简版实现:HKUDS/nanobot

12. Harness Engineering

强调通过构建受控环境,让 Agent 在约束下高效可靠地完成长周期复杂任务。包含围绕 Agent 构建约束机制、反馈回路、可靠上下文等一系列工程实践。


附:Claude Code 相关源码

官方未开源,以下是社区的逆向 / 分支实现,可用于理解其内部结构:

更新于 2026-08-03
Waline