🤖 AI 资讯

· ·
← 返回列表

对话 COBRA-Skills 一作卢平琛:仅用 50 个样本,重构 Agent 技能降本路线

雷锋网2026-09-22 07:55:00大模型,AI应用,对话助手,Agent智能体,设计创意,扩散模型,模型评测,传媒内容,榜单评测,论文原文 ↗
当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。

    作者丨张   璐

    编辑丨马晓宁

                                                                                                       

过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。评估贵,精炼也贵,两笔账算下来,技能优化的效率就成了绕不开的瓶颈。针对这一痛点,来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队,在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种全新的破解思路。论文链接:https://arxiv.org/abs/2609.11682COBRA-Skills 摒弃了盲目堆叠 Token 的演化路线,巧妙地将技能优化转化为一个带预算控制的情境多臂老虎机(Contextual Bandit)问题。它在真实评估前增加了一道“收益预判”机制,确保只有最具潜力或探索价值的候选技能才会进入实际演练,并结合精细化算子迭代种群。凭借这套高效的筛选策略,COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。雷峰网AI 科技评论近日独家对话了论文第一作者卢平琛。在交谈中,他向我们还原了团队如何将“情境多臂老虎机”引入 Agent 技能演化,以及这套低成本范式背后的真实踩坑经历与工程抉择。图片

01


双轮闭环:

经典算法“筛选” + 进化算子“重构”

COBRA-Skills 的设计可以概括成:老虎机负责“选”,进化负责“改”,两者形成一个持续运转的闭环。具体而言,系统维护着一个固定规模的技能种群。在日常迭代中,流程分为三步: 当经典算法遇到 LLM,用概率预判代替盲目试错,或许才是架构演进的真正解法。

    作者丨张   璐

    编辑丨马晓宁

                                                                                                       

过去,智能体的技能(Skill)大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型“自动化生成与优化技能”,成了让 Agent 迈向自主进化的新范式。然而,摆脱了人工编写的束缚,却撞上了高昂的 Token 账单。要验证一个自动生成的技能到底管不管用,必须让智能体带入真实任务中落地执行。每一次试错,都是实打实的 Token 消耗与多轮交互的时间成本。更棘手的是,许多候选技能在刚生成时就自带缺陷。但在现有框架下,我们缺乏“事前筛选”的能力,只能任由大量预算被这些低质候选无意义地吃掉。同时,后续的精炼流程也在频繁调用高阶 LLM,哪怕缺乏有效的新证据,这种“反思—重写”的流水线依然在机械重复。评估贵,精炼也贵,两笔账算下来,技能优化的效率就成了绕不开的瓶颈。针对这一痛点,来自香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队,在论文《COBRA-SKILLS: Contextual Bandit-Guided Evolution for Agent Skill Optimization》中提出了一种全新的破解思路。论文链接:https://arxiv.org/abs/2609.11682COBRA-Skills 摒弃了盲目堆叠 Token 的演化路线,巧妙地将技能优化转化为一个带预算控制的情境多臂老虎机(Contextual Bandit)问题。它在真实评估前增加了一道“收益预判”机制,确保只有最具潜力或探索价值的候选技能才会进入实际演练,并结合精细化算子迭代种群。凭借这套高效的筛选策略,COBRA-Skills 仅用 50 个优化样本,就将优化成本降低了 55%~58%,并在 6 个跨领域 Benchmark 上实现了对现有主流方法的全面超越。雷峰网AI 科技评论近日独家对话了论文第一作者卢平琛。在交谈中,他向我们还原了团队如何将“情境多臂老虎机”引入 Agent 技能演化,以及这套低成本范式背后的真实踩坑经历与工程抉择。

01


双轮闭环:

经典算法“筛选” + 进化算子“重构”

COBRA-Skills 的设计可以概括成:老虎机负责“选”,进化负责“改”,两者形成一个持续运转的闭环。具体而言,系统维护着一个固定规模的技能种群。在日常迭代中,流程分为三步: