手写 SKILL.md 是件折磨人的事——要把操作流程从头到尾描述清楚,记住每个步骤、工具、边界条件,写完发现还漏了两步。微软开源了一个桌面工具 skill-recorder:录一遍屏幕操作,交给 Copilot 拆成「意图 + 有序步骤」,再生成 Agent 能重复执行的 Skill。
四步流程
- 录:按录制键或 ⌘⇧R / Ctrl+Shift+R,正常操作,后台静默记录。
- 控:始终置顶的小条显示捕获状态和麦克风开关,说错话可静音、换麦,整段录废了可丢弃。
- 分析:点 Analyze,Copilot 把操作重构成「整体意图 + 有序步骤」。
- 生成:从审核通过的分析中产出 Skill 或 Automation。

录制的内容包括:窗口切换、应用切换、浏览器地址(目前仅 macOS)、屏幕画面低频快照(屏幕变化时才留帧),以及可选项的语音——通过 Whisper 本地转写 99 种语言。
不是回放,是理解意图
skill-recorder 最聪明的地方在于它不是简单回放点击操作。生成的 Skill 会优先调用 Agent 的原生工具——录的时候用了 gh 命令行,生成的 Skill 就去调 gh;用了网页抓取,生成的 Skill 就用网页抓取。回放太脆弱了,按钮挪个位置、弹窗晚出来两秒就断,而调 CLI 和 API 不会。
更进一步,它能从一次示范中学会提交所有同类表单——不是记住"你填了 2026 年 9 月的报销单",而是理解"你在提交报销单",区分哪些部分固定、哪些可变。这就是 programming by demonstration(示范式编程):你平时怎么教新同事?不会先写 SOP,而是坐他旁边演示一遍。
隐私设计
录制、存储、画面抽取、语音转写全部在本地完成,一个字节都不会离开设备。只有主动点击 Analyze 时,才会把事件时间线、屏幕截图和语音文字发到 GitHub 云端。代码里还有 common/sensitive.ts 在发送前做本地敏感信息检测。
两种产物,三个平台
生成的东西分两种:
- SKILL:SKILL.md 过程文件,Agent 按需运行,适合"需要时才执行"的任务。
- AUTOMATION:同一套流程挂在定时器或触发器上,比如每天检查 CI 状态。
这两种产物直接对接微软三个 Agent 平台:
- Microsoft Scout:放 ~/.copilot/skills/ 自动发现。
- Copilot Cowork:丢进 OneDrive 的 /Documents/Cowork/skills/,会话自动加载。
- Copilot Studio:导入工作区,走企业自动化路子。
安装与使用
分发方式偏源码发布:先下固定版本 Node.js,在本地构建,不往全局装任何东西。
macOS / Ubuntu:
commit=""
curl -fsSL "https://raw.githubusercontent.com/microsoft/skill-recorder/$commit/install.sh" | \
SKILL_RECORDER_COMMIT="$commit" bash
Windows PowerShell:
$commit=""
$env:SKILL_RECORDER_COMMIT=$commit
irm "https://raw.githubusercontent.com/microsoft/skill-recorder/$commit/install.ps1" | iex
macOS 为主要平台,Windows 11 x64/ARM64 都支持,Ubuntu 部分支持。Analyze 需要 GitHub Copilot 权限(学生、教师、开源维护者免费)。

评价
仓库有专门的 evals 目录,自带评估套件(npm run eval 测描述准确度,npm run eval:builder 测泛化能力)。提交记录也很实在,有人在修安装速度、改录制条宽度这种边角问题,正经当产品在做。
最有价值的设计是「分析之后可以人工编辑」——从一次示范里反推意图本来就容易走偏,它没把自己包装成全自动黑盒,而是把审阅环节摆在流程中间。宏记录的是动作,它想记的是意图。
最适合每周或每月重复的流程、跨多个软件的活、复杂到讲不清但演示一遍就懂的事。可以拿它当"流程考古工具":录一遍让 AI 把步骤拆出来,再看哪些该保留、哪些可以删掉。