Agent Skill 如何自动进化?SkillOpt 训练流程解析
Agent Skill 的“自动进化”很容易被误解成让模型读完失败记录,再自由发挥写一版新提示词。SkillOpt 走的是另一条路:模型权重不动,Skill 文档成为唯一被训练的状态;每次改动有预算、有记录,还要经过独立验证。它更像训练循环,而不是一次灵感式润色。
一轮训练先制造证据,再谈修改
当前 Skill 先交给目标模型执行一批任务。每个任务留下消息、工具调用、验证反馈、元数据和最终得分,这一步相当于 forward pass。没有可评分轨迹,后面的优化器就只能猜哪里需要修改,所以“多收集几段聊天”并不等于已经具备训练条件。
失败样本负责纠错,成功样本负责守住已有能力
轨迹被拆成 minibatch 后,优化模型分别分析失败与成功。失败告诉它哪些步骤反复漏掉,成功则提醒它哪些策略已经有效,不能被大改覆盖。随后产生的不是整篇新 Skill,而是有结构的 add、delete、replace 编辑。
相近编辑先聚合去重,再按相关性排序。配置里的 optimizer.learning_rate 不是浮点梯度,而是每一步最多应用多少条文字编辑。预算太大,Skill 容易语义跳跃;预算太小,可能长期修不到关键问题。cosine、linear、constant 三种调度决定训练后期是否逐渐收紧修改幅度。
候选写得再顺,也可能当场被拒绝
选中的编辑应用到当前 Skill,形成 candidate_skill.md。系统随后在 selection split 上重新评分:默认 gate 开启时,候选得分必须严格高于当前版本才被接受。没有提升,当前 Skill 原样保留,失败修改进入 rejected-edit buffer。验证集在这里不是报告用附件,而是防止“越改越差”的刹车。
跨过一个 epoch,还要回头看遗忘
从第二个 epoch 开始,slow update 会拿上一个 epoch 与当前 Skill 在同一批样本上的表现做纵向比较,把结果分成 improved、regressed、persistent-fail 和 stable-success,再生成高层指导。它要解决的不是某一道题,而是多轮修改后逐渐忘掉旧能力的问题。
meta skill 则保存优化器自己的策略记忆:哪些编辑曾经有效,哪些方向失败,剩下的错误模式是什么。它不会塞进最终部署 Skill,而是在后续反思阶段继续约束优化器。这让训练历史有用,却不必把线上 Skill 膨胀成日志仓库。
best_skill.md 只是终点文件,不是终点判断
运行目录会同时保存版本化 Skill、每步候选、轨迹摘要、慢更新和 meta skill。best_skill.md 指向验证表现最好的部署产物,线上 Agent 只需读取它,不增加额外优化模型调用。真正上线前仍应在锁定测试集上单独评估,并查看能力提升是否伴随别的回归。
所以,Agent Skill 的自动进化并不是“让 Agent 自己改自己”。更准确的说法是:用可评分任务制造训练信号,用受限文字编辑控制步幅,再让独立验证集决定哪次变化有资格留下。缺少其中任何一环,自动化都可能只是在更快地积累规则。
-
07.24
疯狂水世界最强阵容T0:五套阵容搭配推荐
-
07.24
使命召唤战区手游骷髅王强度如何 使命召唤战区手游骷髅王实战评测
-
07.24
龙族卡塞尔之门开服时刻表 开服时间是几点
-
07.24
使命召唤战区手游克莱奥如何获取 使命召唤战区手游克莱奥获取教程
-
07.24
疯狂水世界官方下载:官方福利版下载入口
-
07.24
使命召唤战区手游克罗南如何获得 使命召唤战区手游克罗南获取指南
-
- 自由江湖有什么流派
- 07.24
-
- 惊爆 饥荒沃特建家布局超神推荐,速来围观
- 07.24
-
- 星轨牌好玩吗 星轨牌玩法介绍
- 07.24
-
- 7月24日10时《女神星球》新服S337开启
- 07.24
-
- 庄园日历 | 大暑暑期已过半 检查作业进度
- 07.24
-
- 庄园日历 | 角色日奈布生日快乐
- 07.24
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏