30know
Agent:它为什么不只会聊天,还能真正替你干活?

Agent:它为什么不只会聊天,还能真正替你干活?

Agent 这个词,这两年应该已经快被 AI 厂商说烂了。

Codex、Claude Code、WorkBuddy、豆包工作版,千问办公.......看起来完全不是一种东西,但它们都在说自己是 Agent。有的主要写代码,有的帮你做 Word、Excel 和 PPT,还有的能直接读取电脑里的文件、操作浏览器、运行命令。

那么依旧经典连三连问题:

Agent 到底是什么?它是比 LLM 更高级的另一种模型吗?
它到底能替我们做哪些事情,真的可以代替人的工作吗?
市面上又有这么多 Agent,普通人到底应该怎么选?

这篇 agent 入门科普,我们来搞定以上最常见的这三个问题吧

Agent 到底是什么?

Agent 这个单词,直接翻译有“代理人、代理者”的意思,放到 AI 里面一般翻译成“智能体”。

咱们国家在 2026 年发布的 GB/Z 185.1—2026《人工智能 智能体互联 第1部分:总体架构》 里对Agent 定义为:

“感知环境,并主动采取行动以实现特定目标的实体。”

这句话看起来不长,也是中文,但是我相信大部分都看不懂是啥意思,这句话有三个关键词

  1. 特定目标:指 AI不是自己在那里乱跑,而是围绕你交给它的一件事往下做。
  2. 感知环境:它能够读取执行过程中出现的信息,知道刚才那一步发生了什么。
  3. 主动采取行动:它会根据看到的结果判断下一步,再调用工具真的去搜索、读取文件、修改内容或者运行命令。

国外各家给出的说法也不完全一样。

比如Claude 背后的公司 Anthropic,在 《Trustworthy agents in practice》 里是这样定义的:

We define an agent as an AI model that directs its own processes and tool use when accomplishing a task.

我们将智能体 AgenT 定义为一种在完成任务过程中能够自主指挥自身处理流程和工具使用的 AI 模型。

IBM 的说法也差不多,在 AI Agent 的科普页面 里,将 Agent 定义为:利用现有工具自己组织工作流程、并自主完成任务的系统。

这些定义其实说法不一样,但是内核都差不多,核心就是能不能围绕目标进入一个连续循环。

看当前情况 → 判断下一步 → 调用工具行动 → 看执行结果 → 再决定下一步。

直到任务完成,或者遇到必须由人决定的事情,再回来问你,这也是 Agent 和普通聊天 AI 最核心的区别,它不只是给你一段回答,而是开始围绕一个目标可以持续行动。

所以你只需要记得: Agent 就是一个可以连续干活的 AI,会根据你指定的目标去不断完成,自己找资料、运用工具来实现,不再局限于只能输出文字。

那么问题来了,开头提到的 Codex、Claude Code、WorkBuddy、豆包工作版、千问办公....这些市面上常见的 Agent,说到底背后顶着的都是自己家原本就有的大模型,Codex 背后是 ChatGPT,豆包顶着自家模型.....这些模型早就存在很久了,之前也就是聊聊天、给个回答。

那怎么突然间,大家好像都集体学会干活了?

其实模型本身没变多少,真正让它们从"只会说"变成"能动手"的关键是,一个叫 harness 的东西

那么,Harness 又是什么?

2026 年 8 月 13 日,DeepSeek 终于发布了自家的 Agengt,然后名字很直白,直接叫DeepSeek harness 。

paste-20260907-165913

然后在产品的官方页面上直接写了一条很有意思的公式:“Agent = Model + Harness”

并且直接说:“harness 让 Agent 在真实场景中持续工作”

DeepSeek 的这个官方解释其实就很通俗易懂:

模型(Model)是 Agent 的灵魂,而Harness 给予 Agent 理解环境、使用工具,并在真实场景中持续工作的能力。

这里我就先不展开讲 DeepSeek 了,只能说 DeepSeek 的技术感真的很重,别人家官方基本都是写产品的卖点,它倒是先来了一波小科普,前情提要属于是。

那么接下来带大家了解下什么是 harness

Harness 直接翻译有“马具、挽具”的意思,放在 Agent 里面,你就可以把它理解为:控制和组织 Agent 运行的那套系统

它有点像操作系统,它真正影响的是:这一轮给模型看什么信息、模型可以使用哪些工具、能进入什么环境、被给了多大权限,以及工具执行完以后,结果怎么重新交给模型,让任务继续往下跑。

大白话就是:模型负责想下一步干什么,Harness 负责让这一步真的发生,并且把发生以后的结果重新交给模型

这里的 Tools 就是 Agent 能够调用的工具运行环境是它实际干活的地方,可以是本地电脑、云端或者浏览器;Agent Loop 则是“行动一次、查看结果、再决定下一步”的循环。

paste-20260907-165932

不同公司对 Harness 具体包含哪些部分,划分并不完全一样,但是对于普通人来说,先知道这一层就够了:模型负责判断,Harness 负责让判断真的发生,并把结果重新送回来。

你可能也刷到过这样的内容:Codex 可以接入 DeepSeek,WorkBuddy有多重模型可以选择用,市面上绝大多数 Agent,其实都支持自定义换用不同的大模型。

所以很多时候,模型更像是可以更换的“脑子”,真正体现各家 Agent 怎么干活的,反而是 Harness 这套运行系统。

同样一个模型,放进不同的 Agent 里,能用什么工具、能操作什么东西、怎么一步一步把任务做完,最后的体验都可能完全不一样。

再回头看前面提到的,DeepSeek Harness这个名字,其实就很有意思了,别家通常给最终产品取一个自己的名字,比如 Codex、Claude Code、WorkBuddy

DeepSeek 这次反而直接把底下这套运行系统的技术名字 Harness 拿来当了产品名,从技术架构的角度看,这个名字反而挺直白:模型还是模型,它这次重点做的,就是模型外面那套让 Agent 真正能够持续干活的系统。

关于什么是 Agent,这里总结几个核心点

  • Model 是模型,Harness 是让模型持续干活的运行系统,Agent 是最终形成的完整“干活系统/产品”。
  • Agent 是大家最终看到的东西,而Harness 是其中最关键的运行层之一。
  • 各家 Agent 产品,本质上是在做自己的一套 Harness / 工具 / 环境,然后最先适配自家模型能力,当然也能使用别的模型接入进来使用。

Agent 能做什么?

这个问题其实很难直接列一个清单,因为它不是只有“做 PPT”“写代码”“整理文件”这几个固定功能。

Agent 真正厉害的地方,是它能把很多原本独立的能力组合起来。

比如它可以上网搜索,也可以读取你电脑里的文件;可以操作浏览器,也可以运行命令;可以生成文档、表格、PPT,也可以写代码。

这些能力单独看,其实很多 AI 早就有了。

真正不一样的是,Agent 可以围绕一个目标,把它们自己串成一套完整流程:

找资料 → 看资料 → 判断 → 继续搜索 → 整理内容 → 生成文件 → 检查结果 → 继续修改。

Agent 的能力项,大致可以分为三层,这里我就用图来表达了⬇️

paste-20260907-165950

重点:所以理论上,只要对应的工具、环境和权限开放给它,很多过去需要我们坐在电脑前一步一步操作的数字化工作流程,都开始可以交给 Agent 往下做。

而且在未来这个趋势会越来明显,软件会更加兼容 Agent 的控制,也就是 AI 会越来越能替代人类控制电脑进行产出。

所以哇 Agent 可以说是当今电脑上必须上现在真正的必装软件,如果你电脑上都还没一个 Agent 那真是有点“落伍”了,我不想制造焦虑,但是这必然是大势所趋。

但是也不要着急,既然你能看到这样,就说明你已经在学习了!

30 aitool 会陪着你在 AI 的发展中陪着你学习进步的!(突然正能量下)

Ok 继续说回来,那选什么 agent 呢

市面上这么多 Agent,普通人应该怎么选?

现在市面上的 Agent 已经非常多了 ,办公 Agent、编程 Agent、本地 Agent、跑在云端的 Agent,开源的,什么大厂又下场了,又又又突破了什么,又什么拿下的 GitHub 多少颗星星,有什么新架构......

说实话我都看麻了,看焦虑了.....

那么这么多 Agent,普通人到底应该怎么选?

对于小白而言,我直白暴论:无脑选生态最强的,选大厂的。

因为 Agent 这东西现在变化太快了,今天你多一个功能,明天我就抄过来,后天他又换个模型继续追,现在把所有 Agent 一个一个对比完得出的结论,可能明天就变了。

所以对于普通人来说,最简单的办法就是选大家用得最多、背后厂商最有实力的,它不一定每个功能都是第一,但至少及格线不会太低,后面也有人继续更新,出了问题还能搜到教程。

我推荐的第一选择肯定是 Codex。

展开详情
优点
  • 稳,基本什么都能干。属于“没有明显短板”的优等生
  • 用户规模大、生态完整。
缺点
  • 慢,活是能干,但是响应这块是真有点慢
  • API 按 token 计费,相比 Claude、Cursor 这类新选手不算便宜
  • 一些场景下代码质量被 Claude、Cursor 等新兴竞品反超

Codex 基本算是现在 Agent 里面的六边形战士,也是我个人使用最多的。虽然它的名字听起来很像一个专门写代码的工具,但大家现在爱用它,很重要的一个原因就是它的通用性很强。写代码当然可以,读文件、搜资料、整理内容、运行脚本,乱七八糟什么活我都会丢给它。

但是对于完全没接触过 Agent 的小白来说,Codex 还是有一点门槛。你可能要研究账号、配置和使用额度,如果想把它当作长期主力,大概率还得考虑付费。

所以如果你现在连 Agent 都没有用过,我建议就直接装一个 WorkBuddy。

展开详情
优点
  • 操作门槛低,生态集中度高,打通微信飞书等主流软件
  • 该有的功能都有,是桌面的agent当前,毋庸置疑的头部
缺点
  • 待补充

WorkBuddy 最强两点:免费和傻瓜操作

WorkBuddy 比较是腾讯出品还是很大方的,有免费的模型使用,积分送的也大方,就不用先研究怎么买套餐,也不用先折腾各种配置,下载安装以后就可以直接开始用。

互联网大战就是这样,厂商先烧钱抢用户,那我们普通用户就先用着呗。

当然,我不是说你一定只能用 WorkBuddy,你也用 Kimi Work,用其他大厂推出的 Agent,其实也都可以。这个市场现在基本就是你抄我、我抄你,大家的基础能力不会差得特别离谱。

对于小白来说,选哪一个,远没有先开始用重要。

你先装一个,然后真的拿它处理一次文件、整理一次资料,或者让它帮你完成一件工作。哪怕你用完以后觉得不喜欢,再换也没关系,至少你已经知道 Agent 到底是怎么回事了。

如果你愿意稍微折腾一下,也愿意付费,那我还是推荐 Codex,我个人觉得花钱开一个 ChatGPT 会员还是十分值得的,当然这个就取决于个人了。

Codex 后面我肯定也会专门做一篇安装和使用教程,这里就先不展开。

所以关于 Agent 怎么选,咱们就先讲到这里。

如果你的电脑上还没有 Agent,那就先去下一个吧。先用起来,就这么简单。

那么下一章,我们来讲 Agent 里面一个十分重要、而且基本没有什么产品争议的东西,也就是 Skill。

本章小测

7道题

本章配有随堂小测,登录后即可作答并记录成绩。