当我们遇到 DeepSeek Harness、OpenClaw、Claude Code 这一批AI产品,阅读遇到最大的问题就是“陌生的名词”太多。
什么模型、Agent、工具、Skill、插件和工作流... 多种陌生的概念挤在一起,让人读起来十分费劲。
故而,本着实践出真知的原则,本文旨在通过一则具体的业务实例,来解释遇到的名词。
从令人头疼的论文转专利案例开始...
假设我们要做一个论文转专利 Agent。我们可能需要以下的业务步骤:
用户上传论文
↓
读取正文和公式
↓
找出可申请专利的技术点
↓
检索已有专利
↓
生成权利要求
↓
检查每项权利要求是否有原文支持
↓
导出 Word 文档
很显然,这件事已经超出一次问答能回答的范畴。
此时,LLM、Agent、Harness 和 Skill 这些家伙就开始在次任务里承担不同工作了。
LLM 负责理解、思考以及推理
LLM 是 Large Language Model,也就是大语言模型。
语言模型最基础的工作,是根据已经出现的内容估计下一个 Token 的概率。Token 可以是一个字、半个词、一个完整单词或标点。模型在大量文本上训练以后,参数里记录了复杂的语言规律,因此能够回答问题、总结材料、翻译和写代码。
放进论文转专利的例子里,LLM 可以读懂技术描述,提炼创新点,把论文语言改写成专利语言,也可以判断两段权利要求是否重复。 总而言之,就是如同人类大脑般的“思考和推理”
模型单独运行时,只接收一段上下文,再生成一段输出。它不会天然知道公司的内部资料,也不会自行打开专利数据库。文件保存、数据库检索、权限判断和任务重试,都需要外围系统提供。
所以,LLM 是 Agent 使用的判断与生成模块。模型强弱会影响 Agent 的上限,工程系统决定这份能力能不能稳定落到任务上。
Agent 代表行动实施
Agent 是一套能够围绕目标选择动作、读取结果并继续行动的系统。
一次普通的 LLM 调用大致是经过用户提问,模型回答这两步,整个过程就结束了。而 Agent 则会多走几步:它先读取目标和当前状态,决定下一步需要调用哪个工具,观察工具返回的结果,再判断任务是否完成。遇到缺失信息时,它可以继续搜索,也可以停下来询问用户。
论文转专利 Agent 可能先读取 PDF,发现论文缺少实验参数,随后检查附件。它提取技术特征后调用专利检索工具,根据检索结果调整权利要求,最后运行一致性检查。中途究竟需要几轮检索,通常无法提前写死。
这也说明了 Agent 和 Workflow 的区别。Workflow(工作流) 的路径主要由开发者预先规定。第一步读取文件,第二步提取摘要,第三步生成文档 ... 每个节点基本固定。但, Agent 的下一步更多由模型根据现场结果决定。
实际项目经常把两者混合使用。高风险步骤走固定流程(工作流),开放性较强的步骤交给 Agent。 例如专利文件的最终导出可以走确定的模板,技术特征检索则允许 Agent 多轮尝试。
Harness 管理 Agent 怎样运行
Harness 原意是挽具或线束。在软件和 AI 工程里,它通常指围绕核心能力搭建的一套运行与控制设施。这个词目前没有覆盖所有产品的统一行业标准,具体范围要看项目怎样定义。
对 Agent 来说,Harness 往往负责模型调用、上下文装配、工具注册和 Agent Loop。会话状态、失败重试、权限审批、日志、成本记录与沙箱也常放在这一层。
仍然看论文转专利的例子。LLM 决定要检索已有专利,Harness 负责把检索工具的参数格式告诉模型,接住模型发出的调用请求,执行工具,再把结果放回下一轮上下文。模型返回格式异常时,Harness 还要决定怎样记录错误、是否重试以及何时停止。
换模型时,这一层尤其重要。不同模型的消息格式、工具调用、流式输出、推理内容和上下文限制可能不同。一个成熟的 Harness 会用适配器吸收这些差异,让上层 Agent 尽量少改代码。
举个例子 :最近刚上的 DeepSeek Harness 就把这个思路做得很彻底。它的底层框架叫 Cordis,模型适配器、工具注册表、会话日志和 Agent Loop 都以插件形式挂到共享上下文中。这些部分可以通过配置(.yml文件)替换,插件卸载时,它注册的服务和事件也会跟着撤销。
因此,DeepSeek Harness 更接近可组装的 Agent 运行框架,或者可以说 类比 操作系统中linux的内核, 约束(管理)着agent的执行。它给开发者的自由度很高,但相应的,开发者也要理解更多运行细节。
Skill 保存可复用的执行之法
Skill 可以理解为交给 Agent 的专项操作说明和配套材料。换言之,任何人拿到你的skill都可以使用你沉淀的一整套方法,对论文转专利这项业务达到“特事特办”的效率!
Agent Skills 的开放格式规定,一个 Skill 至少包含 SKILL.md。这个文件写明 Skill 的名称、用途、触发条件和执行说明。Skill 还可以附带脚本、参考资料、模板和图片等资源。
它采用按需加载。Agent 启动时先看到 Skill 的名称和简介,任务匹配时再读取完整说明,需要时继续加载脚本或参考文件。这样可以同时准备很多 Skill,又不用把全部内容一次塞进模型上下文。
论文转专利 Skill 可以写清技术特征怎样拆分,权利要求怎样与原文建立支持关系,公式如何转成可编辑格式,最终文档使用什么模板。换成财报分析 Skill,里面保存的会是会计口径、指标计算方式和表格模板。
Skill 和 Tool 很容易混淆。Tool 提供一个可以执行的动作,例如搜索专利、读取 PDF 或生成 Word。Skill 告诉 Agent 什么时候使用这些工具、按什么顺序检查,以及什么样的结果才算合格。
Skill 和 Prompt (提示词) 也有区别。Prompt 是某次模型调用实际看到的指令与材料,也就是你平常聊天时候和LLM对话的内容,也可以说是描述你这次对话的补充信息。Skill 是可以长期维护、按需加载的文件包,其中一部分内容最终会进入 Prompt。
还需要认识哪些基础名词
下面这些词会频繁出现在 Agent 产品文档里。
| 名词 | 它负责什么 | 在论文转专利任务中的例子 |
|---|---|---|
| Prompt | 告诉模型当前身份、目标、限制和输出格式 | 要求模型按专利语言提取技术特征 |
| Token | 模型读取和生成内容时使用的基本单位 | 一篇长论文会占用大量输入 Token |
| Context Window | 一次模型调用能够看到的内容范围 | 当前对话、论文片段和工具结果共同占用上下文 |
| Tool | 供 Agent 调用的外部动作 | 读取 PDF、搜索数据库、生成 DOCX |
| Agent Loop | 让 Agent 反复判断、行动和观察结果的循环 | 检索、比较、修改权利要求,再次检查 |
| Memory | 跨步骤或跨会话保存并取回信息 | 记住用户采用的术语和已经确认的技术特征 |
| RAG | 先检索相关资料,再把资料交给模型生成答案 | 从企业知识库取回专利写作规则 |
| MCP | 让 AI 应用以统一方式连接外部数据和工具的开放协议 | 用 MCP Server 暴露专利检索或文档服务 |
| Plugin | 装载到宿主系统里的软件扩展单元 | 给 Harness 增加模型适配器或工具注册表 |
| Guardrail | 限制危险动作和不合格输出的规则或检查 | 未经确认不得覆盖文件,权利要求缺少依据时停止导出 |
| Eval | 用固定任务和评分规则测量 Agent 表现 | 统计技术特征召回率、引用正确率和文档通过率 |
其中有两个区别很重要。
Context Window (上下文窗口) 更接近模型本次工作的可见材料,容量有限。Memory(记忆) 由系统长期保存,需要时再取回一部分放进 Context。把所有历史记录都塞进上下文,成本会越来越高,相关信息也可能被无关内容淹没。
MCP 解决连接方式。它让 AI 应用通过统一协议接入文件、数据库、搜索服务和其他工具。Skill 解决做法。它保存某类任务的步骤、判断标准和配套资源。两者可以一起使用,一个 Skill 完全可以要求 Agent 调用某个 MCP 工具。
把这些概念放回一套系统
可以把它们整理成下面这组关系。
用户目标
↓
Agent
↓
Harness 负责运行、状态、权限和记录
↓
Agent Loop 反复选择动作并读取结果
├─ LLM 负责理解、判断和生成
├─ Skill 提供专项做法和材料
├─ Tool 执行搜索、读写和调用
├─ MCP 提供连接外部系统的统一方式
└─ Context 与 Memory 提供当前信息和历史信息
这张关系图还能解释为什么同一个模型放进不同 Agent 产品,效果会差很多。产品给模型准备了哪些工具,怎样组织上下文,如何处理错误,Skill 写得是否清楚,循环何时继续或停止,都会改变最后的结果。
选技术方案时也可以顺着这套关系判断。比如:步骤固定、责任边界清楚的任务,Workflow 通常更省心。那么反之,在任务路径经常变化,还需要多轮调用工具的场景中,Agent 则更合适。
团队需要替换模型、管理长会话和控制工具权限时,Harness 的价值会明显增加。行业做法已经稳定,希望多个 Agent 重复使用,便可以整理成 Skill。
希望看到这里各位看官能对这些概念有更好的理解! 如果本文有帮到您,记得帮作者点个红心,您的支持就是对我最大的鼓励!
参考资料
- [Google 机器学习课程中的语言模型介绍] (https://developers.google.com/machine-learning/crash-course/llm)[Anthropic 关于 Agent 与 Workflow 的工程说明] (https://www.anthropic.com/engineering/building-effective-agents)[DeepSeek Harness 架构文档] (https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/architecture.md)[Agent Skills 开放格式说明] (https://agentskills.io/home)[Model Context Protocol 入门文档] (https://modelcontextprotocol.io/docs/getting-started/intro)
199