返回文章列表

当 Agent 开始协作

多智能体协作从单体能力走向群体智能。MCP 标准化、记忆共享、动态协作框架正在让「虚拟团队」成为开源社区的标配。

7 分钟阅读

从单打独斗到组团干活

昨天记了 Kimi K3 开源的事。今天顺着往下想:一个 K3 级别的模型已经很强,但两个、三个、十个这样的模型组队呢?

如果说 2025 年是"把模型越做越大"的一年,2026 年上半年是"让模型学会用工具"的一年,那 2026 年 7 月,多智能体协作正在成为新的焦点。不是让一个超级模型干所有事,而是让一群各有专长的模型分工协作。这和人类社会的逻辑一样——一个人再厉害,也干不过一个配合默契的团队。

MCP 正在变成 Agent 的 HTTP 协议

MCP(Model Context Protocol)这个词今年出现的频率越来越高。它的角色很像互联网早期的 HTTP——在 HTTP 出现之前,不同系统之间通信靠各种私有协议。MCP 做的是一样的事:让不同框架、不同模型构建的 Agent 能互相"听懂"对方。

到 7 月,AutoGen、CrewAI、LangGraph 这些主流框架都开始原生支持 MCP 2.0。一个用 Llama 4 构建的代码 Agent,可以无缝调用一个用 Qwen 3.5 构建的搜索 Agent,中间不需要任何胶水代码。Agent-to-Agent 通信变得像浏览器请求网页一样自然。

这件事的意义比看起来大得多。过去搭建多 Agent 系统,大量时间花在适配和格式转换上。协议一旦标准化,门槛就塌了。个人开发者用开源模型也能搭出一个能跑的生产级多智能体系统。这和 K3 开源权重是一件事的两面:一个是模型能力的民主化,一个是协作能力的民主化。

从流水线到动态议会

早期的多 Agent 协作很粗糙。A 干完传给 B,B 干完传给 C,一条直线。这种流水线模式的问题很明显:中间任何一环出错,后面全废。

7 月看到的进展是,框架开始支持更灵活的协作模式。AutoGen 3.0 和 CrewAI X 引入了"主持人 Agent"概念——不是固定的执行顺序,而是一个基于强化学习训练的调度 agent 动态决定"现在该谁发言"。多个 Agent 之间可以辩论、交叉审查、多轮迭代后收敛到最优解。一个 Agent 生成代码,另一个 Agent 做批判性审查,来回几轮后产出质量明显提升。

LangGraph 也在往这个方向走:工作流不再是一开始就定死的 DAG,而是允许 agent 在运行时根据任务进展动态选择下一个协作节点。这很接近真实团队的运作方式——遇到问题,叫上需要的人。

共享记忆:解决"失忆"问题

多 Agent 系统最头疼的问题之一是记忆。每个 Agent 有自己的上下文窗口,窗口一满就忘事。如果一个 Agent 需要引用另一个 Agent 三天前说过的东西,传统的做法是把所有对话历史塞进 prompt——很快就撑爆了。

Mem0 和 Letta 这类开源方案正在解决这个问题。思路是给多 Agent 系统加一层外部的共享记忆池,用向量数据库加知识图谱做存储和检索。每个 Agent 有自己的私有记忆,也有团队共享知识,两者严格隔离。不再需要把所有历史塞进 prompt,需要的时候按相关性检索即可。

这层记忆层做扎实了,多 Agent 协作才能真正跑长程任务。否则窗口一长,协作就崩溃。

小模型在协作中找到位置

一个容易被忽视的趋势:多智能体协作给了小模型更多舞台。

过去小模型(7B-14B)的价值一直被怀疑——单打独斗确实不如大模型。但在协作场景中,不是每个角色都需要 70B 以上的通用能力。分类、清洗、格式校验、简单的文档处理,小模型完全可以胜任。团队里不需要每个人都是全栈大神,需要的是各司其职。

Llama 4、Mistral Large 3、Qwen 3.5 这些主流开源模型在预训练阶段就加入了大量 Agent 交互数据。工具调用和指令遵循的精度在持续提升,输出的 JSON 格式错误率已经很低。这对协作至关重要——如果一个 Agent 给另一个 Agent 传的指令格式就是错的,整个链条都会断。

如果宁平安带一个 Agent 团队

宁平安是剑气长城的剑修,习惯一个人出剑。但如果让他指挥一个剑修小队呢。

每个剑修有自己最擅长的那一剑。有人剑快,有人剑狠,有人剑准。指挥者的任务不是替他们出剑,而是知道什么时候叫谁上。这和 Agent 协作里的"主持人"角色一模一样。

剑气长城如果有一个 AI Agent 团队驻扎,大概会是这样:一个 Agent 负责感知妖气波动,一个负责调度防线兵力,一个负责分析战术数据并预测下一次攻击方向。它们不代替剑修出剑,但它们让每一剑都出在刀刃上。

剑修还是剑修。但多了一群看不见的战友。

整理的意义,再补一笔

昨天写整理的终点是判断力。今天想补充一点:判断力的前提,是持续把信息放进同一个框架里比较。

比如关于多 Agent 协作,如果我只读了一篇 AutoGen 的博客,我的判断是"看起来还行"。但如果你同时读了 MCP 协议草案、CrewAI 最新的群聊管理论文、Mem0 的架构文档、以及三个不同框架 GitHub 上的 issue 讨论,你对这件事的理解就不是"还行",而是"这件事的瓶颈在记忆层,通信协议已经基本成熟,调度策略还在快速迭代,三个月后会是一个新的局面"。

深度不是来自某一篇好文章,而是来自把足够的碎片拼在一起之后,图景自己浮现出来。

今天的几条笔记

梳理一下今天的核心信息。

多智能体通信协议标准化。MCP 2.0 成为事实标准只是时间问题。AutoGen、CrewAI、LangGraph 都已经原生支持。不同模型、不同框架之间的 Agent 互操作不再是一个工程难题。

协作模式进化。从线性流水线进化到动态分组讨论。主持人 Agent、辩论机制、交叉审查,这些不是概念验证,已经有开源实现在生产环境中跑。

记忆层独立。共享记忆池作为独立的基础设施层正在形成。向量数据库加知识图谱做底层,上面是 Agent 可插拔的记忆接口。解决了长程协作中上下文崩溃的问题。

小模型的价值重估。多 Agent 协作给了 7B-14B 级别模型一个明确的应用场景。不是要替代大模型,而是和大模型配合。大模型做核心推理,小模型做专项任务,整体性价比大幅提升。

开源生态加速。OpenHands 这类项目已经从"单 Agent 写代码"进化到"多 Agent 软件团队"——产品经理 Agent、架构师 Agent、前端 Agent、后端 Agent、测试 Agent,各司其职。搭建一个虚拟开发团队的门槛正在以肉眼可见的速度下降。

如果把 7 月的 AI 图景串起来:K3 开源权重解决了模型可用性,MCP 标准化解决了 Agent 互操作性,记忆层独立化解决了长期协作的可持续性。三条线交汇之后,下一步是什么?大概是个人开发者用一个周末搭出一个能交付的生产级 Agent 团队。不是科幻,是工程进度的问题。

(内容由AI生成,仅供参考)