工具 / SkillOpt

SkillOpt

  • agent
  • skill
  • framework

不改模型权重,把 skill 文档当可训练状态,用 rollout-反思-编辑-验证门控循环自动优化

微软 Research 出品的文本空间优化器:把 agent 的 `best_skill.md` 当作可训练状态,冻结目标模型不动,用另一个 optimizer 模型分析 rollout 轨迹、提出有界的增/删/改编辑,只有通过 held-out 验证门控的候选编辑才会被接受。训练循环镜像深度学习范式——rollout 对应前向传播、反思对应反向传播、文本学习率控制每步编辑量、慢更新和 meta skill 提供跨 epoch 记忆。部署产物是一份紧凑的 skill 文档(通常 300–2,000 token),对推理零额外开销。支持 OpenAI、Azure、Anthropic Claude、Qwen、MiniMax 等后端,以及 Codex CLI 和 Claude Code CLI 两种 agentic harness。内置 SearchQA、DocVQA、ALFWorld、LiveMath、SpreadsheetBench、OfficeQA 六种 benchmark。另含 SkillOpt-Sleep 预览版,可将训练循环用于本地 coding agent 的夜间自我进化。

社区实测

SkillOpt 将 Markdown 技能文件作为可训练参数,在不动模型权重的前提下系统化优化智能体表现,社区关注度高但落地仍在早期验证阶段。

  • 无须微调模型即可提升智能体准确率,在 GPT-5.5 上准确率提升 +23.5 个百分点
  • 在 52 个评估单元上取得一致增益,覆盖客服、代码生成、文档处理等场景
  • 技能文件保持可读、可审计、可迁移的紧凑 Markdown 格式,方便团队协作与版本管理
  • 论文提出的文本空间优化与深度学习训练的类比虽优雅,但作者指出仍有若干问题尚未解决
  • 第三方集成(Claude Code、Codex、Copilot、Devin)的插件文件仅存在于仓库中而非 PyPI 分发包,集成成熟度待观察

截至 2026-07-22

pip install skillopt

← 返回工具库