2026-08-07 14:36:06 西盟科技资讯
一个智能体会解题,不意味着它会与其他智能体共事。
在真实世界中,智能体不仅需要理解环境,还要面对持续变化的人、机器人与软件系统:判断对方的意图、预测对方的行动,并根据反馈不断调整自身策略。这种“思考他者如何思考”的能力,是智能体从独立执行走向协作行动的重要基础。
继多模态推理论文POLIA之后,云蝶科技科研团队赵梦辰老师指导并担任通讯作者的第二项研究成果《Strat-Reasoner: Reinforcing Strategic Reasoning of LLMs in Multi-Agent Games》在第43届国际机器学习大会(International Conference on Machine Learning,ICML 2026)发表。这也是云蝶科技科研团队在同一届ICML上发表的第二项研究成果。


Strat-Reasoner:让智能体学会“推演他者”
传统大模型擅长回答问题、生成代码和完成数学推理,但这些任务通常可以被视为单一模型面对一个相对稳定的问题。
多智能体环境则完全不同。其他参与者也会观察、判断和改变策略,最终结果由多个智能体共同造成。仅依据输赢给予奖励,很难判断模型中间哪一步推理正确,又在哪一次对他者意图的理解中出现偏差。
Strat-Reasoner是一套面向多智能体博弈的强化学习框架。它让模型在采取行动前,依次思考对方上一轮的意图、对方如何判断自己、自己当前希望实现的目标,以及对方下一轮可能采取的行动。
模型因此不再只计算“我下一步应该做什么”,而是把其他智能体的意图、判断与潜在行动共同纳入决策。

Strat-Reasoner让智能体显式分析并预测其他智能体的意图和行动
在训练过程中,系统还会将模型对对方的预测,与对方实际表达的意图和最终行动进行比较,再结合整场博弈结果,共同优化模型的战略推理能力。
通俗来说,传统强化学习主要判断“最后赢没赢”;Strat-Reasoner还会继续追问:你是否真正理解了对方?你的预测是否被下一步行动验证?最终结果来自有效推理,还是偶然发生?
Strat-Reasoner把过去难以直接监督的“揣摩他者”,转化为可以结构化、比较、反馈和优化的训练对象。
论文以Qwen3-4B为基础模型,在三类多智能体游戏、超过500局评测中实现平均22.1%的战略表现提升。在Kuhn Poker两种行动顺序测试中,其得分均高于GPT-5-mini和Gemini 2.5 Flash。

实验还显示,Strat-Reasoner在未参与训练的游戏环境中仍保持较强表现,说明模型学习到的战略推理方式具有一定的跨环境迁移能力。
同届两项成果:从“看对”到“读懂彼此”
POLIA与Strat-Reasoner并不是两项彼此孤立的研究。
POLIA关注模型能否识别并使用正确的视觉证据,让判断锚定真实环境;Strat-Reasoner则将研究进一步推进到多智能体关系中,关注模型能否理解其他行动者的意图、预测其行为并调整自身策略。
前者解决“我是否看对了”,后者进一步回答“我是否理解了与你共同参与任务的其他智能体”。
从理解环境到理解他者,两项研究作为云蝶科技和华南理工大学共建的“多智能体具身智能联合实验室”的重要成果,构成云蝶科技推进协作式具身智能基础研究的两个支点。
联合实验室围绕视觉-语言-动作模型训练部署、强化学习优化、世界模型辅助决策及真实场景验证开展研究,持续探索具身机器人在复杂服务环境中的任务理解、行动决策、环境适应与协同能力。
真实世界中的具身智能不会只面对静止物体和确定指令。它需要理解人的需求,与其他机器人协调任务,响应环境变化,并在不完整信息下持续调整行动。
Strat-Reasoner目前主要在双智能体交替博弈环境中完成方法验证,尚不等同于多机器人真实场景落地。但其研究的“理解他者、预测行动、动态调整策略”,正是智能体从单体执行迈向多智能体协作需要解决的基础问题。
同届两项成果发表于ICML 2026,意味着云蝶科技科研团队正沿着一条连续的研究路线向前推进:让智能体不仅能够看懂世界,也能够理解共同参与这个世界的其他行动者。
未来智能体的竞争,不只是谁能独立完成更多任务,更是谁能在由人、机器人和系统共同组成的真实世界中理解彼此、协同行动。