1. 笔记/

《KIMI K2.5: VISUAL AGENTIC INTELLIGENCE》阅读笔记

《KIMI K2.5: VISUAL AGENTIC INTELLIGENCE》阅读笔记 #

原文链接: https://zhuanlan.zhihu.com/p/2010760942347114147 作者: 欧气满满 编辑时间: 2026-02-27


1. 基本信息与核心目标 #

模型定位:开源多模态代理模型(Open-source Multimodal Agentic Model)

核心目标:推进通用代理智能(General Agentic Intelligence)。不仅局限于对话,更强调自主规划、工具调用、多步推理及复杂任务执行能力


2. 关键技术突破 #

Kimi K2.5 的核心竞争力建立在两大支柱之上:多模态联合优化代理群并行编排

2.1 多模态联合优化 (Joint Optimization of Text and Vision) #

模型并未简单拼接文本与视觉能力,而是通过全链路的联合训练实现"眼脑协同"。

预训练阶段 (Pre-training) #

  • 早期融合策略:不同于传统晚期加入视觉 token 的做法,K2.5 在整个训练过程中保持文本与视觉 token 的固定比例混合,早期融合效果更佳。

  • 架构升级 (MoonViT-3D)

    • 支持原生分辨率输入。
    • 视频理解:引入轻量级 3D ViT 压缩机制,将连续 4 帧分组处理并时间平均。在相同上下文窗口下,可处理 4 倍长度的视频,且图像与视频编码器权重完全共享。

后训练阶段 (Post-training) #

  • Zero-vision SFT:发现仅用文本数据进行监督微调(SFT)即可激活视觉推理能力。强行加入人工设计的视觉轨迹反而损害泛化性,证明预训练阶段的对齐已足够强。

  • 联合强化学习 (Joint RL):视觉任务的 RL 训练不仅提升视觉能力,还能反哺文本性能(如 MMLU-Pro 提升),实现了"文本引导视觉,视觉 refine 文本"的双向增强。

2.2 Agent Swarm:代理群并行编排 #

为解决传统代理模型串行执行导致的延迟高、复杂度受限问题,K2.5 引入了动态并行框架。

核心痛点:串行执行导致任务耗时随复杂度线性增长,且容易耗尽上下文与工具预算。

解决方案:Agent Swarm 框架,通过动态任务分解,实例化子代理(Sub-agents)并发执行子任务。

训练范式 (PARL) #

  • 解耦架构:可训练的编排器 (Orchestrator) + 冻结的子代理 (Frozen Sub-agents)。

    • 设计动机:避免端到端联合优化的"信用分配模糊"和"训练不稳定"问题。子代理输出视为环境观测,编排器负责调度。
  • 并行策略学习:并行与否并非预设,而是通过强化学习根据环境反馈动态决定。

  • 评估指标:关键步骤 (Critical Steps)。类比计算图中的关键路径,总耗时取决于每一阶段中耗时最长的子代理。这迫使模型进行负载均衡的 task decomposition,而非单纯增加并发数。


3. 训练策略详解 #

后训练阶段(Post-Training)是模型能力成型的关键,K2.5 在 SFT 和 RL 阶段均采用了创新策略。

3.1 监督微调 (SFT) #

  • 数据合成:基于 Kimi K2、K2 Thinking 及内部专家模型合成高质量候选回复。
  • 制作流程:特定领域流水线 + 人工标注 + 高级提示工程 + 多阶段验证。
  • 目标:优先训练交互式推理和精确工具调用能力。

3.2 强化学习 (RL) 算法优化 #

策略优化 (Policy Optimization) #

  • 引入 Token 级裁剪机制 (Token-level clipping)。区别于标准 PPO,该方法严格基于 log-ratio 限制离线策略漂移,无论优势函数符号如何。
  • 作用:显著提升长程、多步工具使用任务的训练稳定性。
  • 优化器:使用 MuonClip。

奖励函数设计 (Reward Function) #

  • 规则奖励:针对有标准答案的任务(推理、代理)。
  • 生成式奖励模型 (GRMs):针对通用任务,提供细粒度评估(有用性、细节、美学、指令遵循),避免二元判断的粗糙。
  • 视觉专用奖励
    • grounding (IoU)
    • 点定位 (高斯距离)
    • 分割 (Mask IoU)
    • OCR (编辑距离) 等设计特定几何/文本匹配奖励。

防作弊机制 #

  • $r_{parallel}$:防止"串行坍塌"(鼓励并行)。
  • $r_{finish}$:防止"虚假并行"(鼓励子任务真正完成)。

3.3 Token 高效强化学习 (Toggle 策略) #

问题:强制限制 Token 预算会导致长度过拟合 (Length-overfitting),模型习惯短思考后,遇到难题无法利用更多计算资源。

解决方案:Toggle 启发式算法。

  • Phase 0 (预算限制):仅当模型准确率超过阈值时,才强制限制 Token 预算(逼迫简洁)。
  • Phase 1 (标准扩展):不限制预算,允许模型充分利用计算资源追求最佳性能。
  • 交替训练:每 m 次迭代切换一次模式。

效果:输出 Token 减少 25~30%,性能几乎无损失,且减少了思维链中的冗余模式。


4. 性能表现与评估 #

  • 综合性能:在代码生成、视觉理解、逻辑推理、多步代理任务等多个 Benchmark 上达到 SOTA (State-of-the-Art)。

  • 视觉转代码:在 image/video-to-code 生成任务上表现优异。

  • 效率提升

    • Agent Swarm 框架相比单代理基线,延迟降低高达 4.5 倍
    • 任务准确率提升:Item-level F1 从 72.8% 提升至 79.0%
  • 泛化能力:Toggle 策略在数学/代码任务上训练出的效率提升,可泛化至 GPQA 和 MMLU 等通用领域。


5. 总结与启示 #

Kimi K2.5 的技术报告展示了一条清晰的通用代理智能演进路径:

  1. 多模态不再是附加项:通过联合预训练和联合 RL,视觉与文本能力实现了真正的双向增强,而非单向依赖。

  2. 代理架构向并行演进:面对复杂任务,串行思维链(CoT)已遇瓶颈,动态并行编排(Agent Swarm) 是提升效率和解决复杂问题的关键方向。

  3. 训练稳定性与效率并重:通过 Token 级裁剪、解耦训练架构以及 Toggle 策略,解决了大模型 RL 训练中的稳定性难题和推理成本难题。

  4. 开源生态建设:开源权重将降低社区研究代理智能的门槛,有望加速多模态代理在实际应用中的落地。

核心洞察 #

Kimi K2.5 不仅是一个更强的模型,更提供了一套如何训练多模态代理的方法论(如 Zero-vision SFT、PARL、Toggle),这对后续研究具有极高的参考价值。