• 正文
  • 相关推荐
申请入驻 产业图谱

AI Agent 到底是什么?一文分清 LLM、Harness、Skill

4小时前
199
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

当我们遇到 DeepSeek Harness、OpenClaw、Claude Code 这一批AI产品,阅读遇到最大的问题就是“陌生的名词”太多。

什么模型、Agent、工具、Skill、插件和工作流... 多种陌生的概念挤在一起,让人读起来十分费劲。

故而,本着实践出真知的原则,本文旨在通过一则具体的业务实例,来解释遇到的名词。

从令人头疼的论文转专利案例开始...

假设我们要做一个论文转专利 Agent。我们可能需要以下的业务步骤:

 

用户上传论文
   ↓
读取正文和公式
   ↓
找出可申请专利的技术点
   ↓
检索已有专利
   ↓
生成权利要求
   ↓
检查每项权利要求是否有原文支持
   ↓
导出 Word 文档

 

很显然,这件事已经超出一次问答能回答的范畴。

此时,LLM、Agent、Harness 和 Skill 这些家伙就开始在次任务里承担不同工作了。

LLM 负责理解、思考以及推理

LLM 是 Large Language Model,也就是大语言模型。

语言模型最基础的工作,是根据已经出现的内容估计下一个 Token 的概率。Token 可以是一个字、半个词、一个完整单词或标点。模型在大量文本上训练以后,参数里记录了复杂的语言规律,因此能够回答问题、总结材料、翻译和写代码。

放进论文转专利的例子里,LLM 可以读懂技术描述,提炼创新点,把论文语言改写成专利语言,也可以判断两段权利要求是否重复。 总而言之,就是如同人类大脑般的“思考和推理”

模型单独运行时,只接收一段上下文,再生成一段输出。它不会天然知道公司的内部资料,也不会自行打开专利数据库。文件保存、数据库检索、权限判断和任务重试,都需要外围系统提供。

所以,LLM 是 Agent 使用的判断与生成模块。模型强弱会影响 Agent 的上限,工程系统决定这份能力能不能稳定落到任务上。

Agent 代表行动实施

Agent 是一套能够围绕目标选择动作、读取结果并继续行动的系统。

一次普通的 LLM 调用大致是经过用户提问,模型回答这两步,整个过程就结束了。而 Agent 则会多走几步:它先读取目标和当前状态,决定下一步需要调用哪个工具,观察工具返回的结果,再判断任务是否完成。遇到缺失信息时,它可以继续搜索,也可以停下来询问用户。

论文转专利 Agent 可能先读取 PDF,发现论文缺少实验参数,随后检查附件。它提取技术特征后调用专利检索工具,根据检索结果调整权利要求,最后运行一致性检查。中途究竟需要几轮检索,通常无法提前写死。

这也说明了 Agent 和 Workflow 的区别。Workflow(工作流) 的路径主要由开发者预先规定。第一步读取文件,第二步提取摘要,第三步生成文档 ... 每个节点基本固定。但, Agent 的下一步更多由模型根据现场结果决定。

实际项目经常把两者混合使用。高风险步骤走固定流程(工作流),开放性较强的步骤交给 Agent。 例如专利文件的最终导出可以走确定的模板,技术特征检索则允许 Agent 多轮尝试。

Harness 管理 Agent 怎样运行

Harness 原意是挽具线束。在软件和 AI 工程里,它通常指围绕核心能力搭建的一套运行与控制设施。这个词目前没有覆盖所有产品的统一行业标准,具体范围要看项目怎样定义。

对 Agent 来说,Harness 往往负责模型调用、上下文装配、工具注册和 Agent Loop。会话状态、失败重试、权限审批、日志、成本记录与沙箱也常放在这一层。

仍然看论文转专利的例子。LLM 决定要检索已有专利,Harness 负责把检索工具的参数格式告诉模型,接住模型发出的调用请求,执行工具,再把结果放回下一轮上下文。模型返回格式异常时,Harness 还要决定怎样记录错误、是否重试以及何时停止。

换模型时,这一层尤其重要。不同模型的消息格式、工具调用、流式输出、推理内容和上下文限制可能不同。一个成熟的 Harness 会用适配器吸收这些差异,让上层 Agent 尽量少改代码。

举个例子 :最近刚上的 DeepSeek Harness 就把这个思路做得很彻底。它的底层框架叫 Cordis,模型适配器、工具注册表、会话日志和 Agent Loop 都以插件形式挂到共享上下文中。这些部分可以通过配置(.yml文件)替换,插件卸载时,它注册的服务和事件也会跟着撤销。

因此,DeepSeek Harness 更接近可组装的 Agent 运行框架,或者可以说 类比 操作系统中linux的内核, 约束(管理)着agent的执行。它给开发者的自由度很高,但相应的,开发者也要理解更多运行细节。

Skill 保存可复用的执行之法

Skill 可以理解为交给 Agent 的专项操作说明和配套材料。换言之,任何人拿到你的skill都可以使用你沉淀的一整套方法,对论文转专利这项业务达到“特事特办”的效率!

Agent Skills 的开放格式规定,一个 Skill 至少包含 SKILL.md。这个文件写明 Skill 的名称、用途、触发条件和执行说明。Skill 还可以附带脚本、参考资料、模板和图片等资源。

它采用按需加载。Agent 启动时先看到 Skill 的名称和简介,任务匹配时再读取完整说明,需要时继续加载脚本或参考文件。这样可以同时准备很多 Skill,又不用把全部内容一次塞进模型上下文。

论文转专利 Skill 可以写清技术特征怎样拆分,权利要求怎样与原文建立支持关系,公式如何转成可编辑格式,最终文档使用什么模板。换成财报分析 Skill,里面保存的会是会计口径、指标计算方式和表格模板。

Skill 和 Tool 很容易混淆。Tool 提供一个可以执行的动作,例如搜索专利、读取 PDF 或生成 Word。Skill 告诉 Agent 什么时候使用这些工具、按什么顺序检查,以及什么样的结果才算合格。

Skill 和 Prompt (提示词) 也有区别。Prompt 是某次模型调用实际看到的指令与材料,也就是你平常聊天时候和LLM对话的内容,也可以说是描述你这次对话的补充信息。Skill 是可以长期维护、按需加载的文件包,其中一部分内容最终会进入 Prompt。

还需要认识哪些基础名词

下面这些词会频繁出现在 Agent 产品文档里。

名词 它负责什么 在论文转专利任务中的例子
Prompt 告诉模型当前身份、目标、限制和输出格式 要求模型按专利语言提取技术特征
Token 模型读取和生成内容时使用的基本单位 一篇长论文会占用大量输入 Token
Context Window 一次模型调用能够看到的内容范围 当前对话、论文片段和工具结果共同占用上下文
Tool 供 Agent 调用的外部动作 读取 PDF、搜索数据库、生成 DOCX
Agent Loop 让 Agent 反复判断、行动和观察结果的循环 检索、比较、修改权利要求,再次检查
Memory 跨步骤或跨会话保存并取回信息 记住用户采用的术语和已经确认的技术特征
RAG 先检索相关资料,再把资料交给模型生成答案 从企业知识库取回专利写作规则
MCP 让 AI 应用以统一方式连接外部数据和工具的开放协议 用 MCP Server 暴露专利检索或文档服务
Plugin 装载到宿主系统里的软件扩展单元 给 Harness 增加模型适配器或工具注册表
Guardrail 限制危险动作和不合格输出的规则或检查 未经确认不得覆盖文件,权利要求缺少依据时停止导出
Eval 用固定任务和评分规则测量 Agent 表现 统计技术特征召回率、引用正确率和文档通过率

其中有两个区别很重要。

Context Window (上下文窗口) 更接近模型本次工作的可见材料,容量有限。Memory(记忆) 由系统长期保存,需要时再取回一部分放进 Context。把所有历史记录都塞进上下文,成本会越来越高,相关信息也可能被无关内容淹没。

MCP 解决连接方式。它让 AI 应用通过统一协议接入文件、数据库、搜索服务和其他工具。Skill 解决做法。它保存某类任务的步骤、判断标准和配套资源。两者可以一起使用,一个 Skill 完全可以要求 Agent 调用某个 MCP 工具。

把这些概念放回一套系统

可以把它们整理成下面这组关系。

用户目标
   ↓
Agent
   ↓
Harness 负责运行、状态、权限和记录
   ↓
Agent Loop 反复选择动作并读取结果
   ├─ LLM 负责理解、判断和生成
   ├─ Skill 提供专项做法和材料
   ├─ Tool 执行搜索、读写和调用
   ├─ MCP 提供连接外部系统的统一方式
   └─ Context 与 Memory 提供当前信息和历史信息

这张关系图还能解释为什么同一个模型放进不同 Agent 产品,效果会差很多。产品给模型准备了哪些工具,怎样组织上下文,如何处理错误,Skill 写得是否清楚,循环何时继续或停止,都会改变最后的结果。

选技术方案时也可以顺着这套关系判断。比如:步骤固定、责任边界清楚的任务,Workflow 通常更省心。那么反之,在任务路径经常变化,还需要多轮调用工具的场景中,Agent 则更合适。

团队需要替换模型、管理长会话和控制工具权限时,Harness 的价值会明显增加。行业做法已经稳定,希望多个 Agent 重复使用,便可以整理成 Skill。

希望看到这里各位看官能对这些概念有更好的理解! 如果本文有帮到您,记得帮作者点个红心,您的支持就是对我最大的鼓励!

参考资料

    [Google 机器学习课程中的语言模型介绍] (https://developers.google.com/machine-learning/crash-course/llm)[Anthropic 关于 Agent 与 Workflow 的工程说明] (https://www.anthropic.com/engineering/building-effective-agents)[DeepSeek Harness 架构文档] (https://github.com/deepseek-ai/deepseek-harness/blob/master/docs/architecture.md)[Agent Skills 开放格式说明] (https://agentskills.io/home)[Model Context Protocol 入门文档] (https://modelcontextprotocol.io/docs/getting-started/intro)

相关推荐