SkillOpt
不改模型权重,把 skill 文档当可训练状态,用 rollout-反思-编辑-验证门控循环自动优化
微软 Research 出品的文本空间优化器:把 agent 的 `best_skill.md` 当作可训练状态,冻结目标模型不动,用另一个 optimizer 模型分析 rollout 轨迹、提出有界的增/删/改编辑,只有通过 held-out 验证门控的候选编辑才会被接受。训练循环镜像深度学习范式——rollout 对应前向传播、反思对应反向传播、文本学习率控制每步编辑量、慢更新和 meta skill 提供跨 epoch 记忆。部署产物是一份紧凑的 skill 文档(通常 300–2,000 token),对推理零额外开销。支持 OpenAI、Azure、Anthropic Claude、Qwen、MiniMax 等后端,以及 Codex CLI 和 Claude Code CLI 两种 agentic harness。内置 SearchQA、DocVQA、ALFWorld、LiveMath、SpreadsheetBench、OfficeQA 六种 benchmark。另含 SkillOpt-Sleep 预览版,可将训练循环用于本地 coding agent 的夜间自我进化。
社区实测
SkillOpt 将 Markdown 技能文件作为可训练参数,在不动模型权重的前提下系统化优化智能体表现,社区关注度高但落地仍在早期验证阶段。
- 无须微调模型即可提升智能体准确率,在 GPT-5.5 上准确率提升 +23.5 个百分点
- 在 52 个评估单元上取得一致增益,覆盖客服、代码生成、文档处理等场景
- 技能文件保持可读、可审计、可迁移的紧凑 Markdown 格式,方便团队协作与版本管理
- 论文提出的文本空间优化与深度学习训练的类比虽优雅,但作者指出仍有若干问题尚未解决
- 第三方集成(Claude Code、Codex、Copilot、Devin)的插件文件仅存在于仓库中而非 PyPI 分发包,集成成熟度待观察
Microsoft SkillOpt Explained: How to Train AI Agent Skills (2026 Guide)SkillOpt: Agent skills as trainable parameters - Microsoft ResearchMicrosoft SkillOpt Paper Improves AI Agent Skills by 20%Microsoft's open-source SkillOpt automatically upgrades AI agent skills without touching model weightsGitHub - microsoft/SkillOpt
截至 2026-07-22
pip install skillopt git clone https://github.com/microsoft/SkillOpt.git && cd SkillOpt && pip install -e .