Claude Record a Skill:录屏一次,永久自动化你的工作流

2026 年 7 月 21 日,Anthropic 在 Claude 桌面应用的 Cowork 模式中上线了 "Record a Skill" 功能。用户录屏完成一次任务操作,同时用语音讲解每一步的逻辑,Claude 自动将这段演示转化为可重复调用的 Skill。整个过程不需要写一行 Markdown,不需要理解 SKILL.md 的结构,甚至不需要知道什么是 prompt engineering。
这是什么
Claude Cowork 是 Anthropic 在 2026 年推出的桌面端 Agent 工作空间。与普通聊天模式不同,Cowork 模式下的 Claude 可以直接操作用户的电脑:打开浏览器、点击按钮、填写表单、管理文件。在这个基础上,"Record a Skill" 把工作流的创建门槛降到了几乎为零。
操作流程直截了当:
- 打开 Claude 桌面应用,切换到 Cowork 模式
- 点击聊天框左下角的 + 按钮,选择 Record a skill
- 选择麦克风,点击 Start Recording 开始录屏
- 一边操作一边讲解,完成后停止录制
- Claude 分析录屏内容(点击序列、页面导航、操作上下文),自动生成一个 Skill
- 点击 Save Skill 保存,之后通过斜杠命令(如
/file-expenses)随时调用
Anthropic 工程师 Lydia Hallie 在发布当天分享了自己的使用体验:"我一直在用它处理那些一直想自动化但没动手做的工作流。录制一遍操作,Claude 就把它变成了可以重复运行的 Skill。如果某个步骤已经有现成的 connector,它还会主动推荐。"
该功能目前面向 Pro、Max 和 Team 计划用户分阶段开放。
从坐标录制到语义录制
Record a Skill 看起来像传统的屏幕录制宏(RPA),但底层逻辑完全不同。传统 RPA 工具(UiPath、Automation Anywhere 等)录制的是坐标级别的操作轨迹:在第 X 像素点击,在第 Y 毫秒输入文本 Z。这种方式一旦遇到按钮位移、弹窗顺序变化或界面微调就会崩溃。
Claude 的 Record a Skill 走的是另一条路。MIT 研究者 Tobin South 在测试后总结了一个关键观察:"you'd be amazed how dumb you can be"(你会惊讶于自己可以做到多"笨")。他的意思是:Claude 从录屏中提取的是操作意图(semantic intent),而非逐像素的操作回放。它理解"你在做什么、为什么这样做",然后把这个理解翻译成可执行的 Skill 定义。
具体差异体现在三个维度:
- 容错性:UI 发生轻微变化(按钮移动、页面重排)时,传统 RPA 宏会断掉,而基于语义理解的 Skill 可以适应这些漂移
- 可编辑性:生成的 Skill 输出为
SKILL.md格式的结构化文档,用户可以在保存后手动编辑,调整步骤、增加异常处理、修改触发条件 - 跨应用能力:Record a Skill 通过 Cowork 的 Computer Use 能力跨越应用边界,一个录制可以涉及浏览器、桌面应用和文件系统
Skill 的技术结构
理解 Record a Skill 的价值,需要先了解 Claude Skill 本身的设计。每个 Skill 的核心是一个独立目录,包含一个 SKILL.md 文件和可选的脚本、模板等资源。SKILL.md 是核心,包含三个部分:
- 名称和描述:这是 Claude 唯一默认加载到上下文的内容,通过 progressive disclosure 机制,只有当 Claude 判断某个 Skill 与当前任务相关时才会读取完整内容
- 步骤指令:详细的操作流程,告诉 Claude 在什么条件下做什么
- 可选脚本和资源:可执行代码、模板文件等
这种设计让 Skill 比 agent.md 或 CLAUDE.md 之类的全局配置文件高效得多。后者每轮对话都会加载全部内容到上下文窗口,快速消耗 token 预算并降低模型表现。Skill 只在需要时加载,节省了数千 token 的开销。
Record a Skill 之前,创建一个自定义 Skill 需要手动编写 SKILL.md 文件,对非技术用户来说门槛很高。录制功能把这道墙拆掉了:你只需要做一遍,说一遍,剩下的交给 Claude。
实际应用场景
发布后 24 小时内,社区已经涌现了一批早期用例:
- 报销流程自动化:录制一遍从邮件提取收据、登录报销系统、填写表单、提交审批的完整流程,之后一键运行
- 交易提醒设置:录制在交易平台上配置价格提醒的步骤,Claude 生成 Skill 后可以快速复用到不同标的
- LinkedIn 运营:录制发布动态、回复评论、导出联系人的操作流程
- 邮件处理:录制按特定规则筛选邮件、生成回复草稿、归档的工作流
- YouTube 数据下载:一位用户录制了 57 秒的操作流程,展示了从 YouTube Studio 下载数据的完整步骤,Claude 在录制过程中截取了每个关键界面的截图,最终生成可重复调用的 Skill
36 氪在报道中记录了一个更极端的案例:一位自由撰稿人用 Claude Cowork 构建了客户内容生成工作流。她上传了品牌文档、风格指南和历史文章作为 Skill 资源包,系统就能按 Skill 工作流输出月度内容日历。在交接时,客户说了一句:"既然你要走了,能不能把这个全设置好,让我们自己跑?"五年的合作关系被一个 Skill 文件夹取代。
隐私悬而未决
Record a Skill 的核心争议在于隐私。录屏功能捕获的信息远比普通文本提示更敏感:屏幕上可能包含密码、API Key、信用卡号、客户数据等敏感信息。启动录制时,界面会明确警告用户:"Your screen, clicks, typing, and voice are recorded, then sent to Claude and turned into a repeatable skill."(你的屏幕、点击、输入和语音将被录制,发送给 Claude 并转化为可重复的技能。)
截至本文发布时,Anthropic 尚未公布专门的技术文档说明以下问题:
- 录屏数据的存储周期
- 录屏是否用于模型训练
- 管理员对 Team 计划下的录制数据有什么控制权
- 录制过程中意外捕获的敏感信息如何处理
Coursiv 在技术评测中明确指出:"不要自行编造这些问题的答案;在录制涉及机密工作内容之前,检查产品 UI 和你所在组织的 Anthropic 服务条款。"
对企业用户来说,这意味着在合规审计完成之前,不宜用 Record a Skill 处理涉及客户数据、财务信息或受监管行业数据的流程。个人用户则需要养成录制前关闭无关窗口、清理剪贴板的习惯。
对工作流的深层影响
Record a Skill 降低了 Skill 创建的技术门槛,但也降低了复制坏习惯的门槛。如果演示过程包含多余步骤、不安全的快捷方式、不一致的命名或不言而喻的假设,这些问题会原封不动地进入生成的 Skill。Claude 能从录屏中提取语义意图,但它不会替你设计一个干净的工作流。
Coursiv 在评测中提出了一个精准的判断:"录制并没有消除流程设计的需要。它让薄弱的流程也更容易被复制。"
这个功能真正改变的是"知识转移"的成本结构。过去,将一个人的工作经验转化为另一个人(或另一个 AI)可执行的步骤,需要写文档、做培训、反复对齐。Record a Skill 把这个成本压缩到了"录制一次演示"的量级。在 Team 计划中,一个人的 Skill 可以直接共享给整个团队。
哈佛商学院 2026 年 3 月发布的数据为这个趋势提供了量化脚注:AI 暴露度最高的岗位,招聘需求下降了 17%,而要求人机协作的岗位招聘需求上升了 22%。竞争的焦点已经转移:能否做出别人无法复制的工作,正在取代能否完成某项任务,成为新的分水岭。
谁能用、怎么找
Record a Skill 目前仅在 Claude 桌面应用的 Cowork 模式中可用。Web 版和 Claude Code(终端版)暂未支持录制功能。
使用步骤:
- 下载 Claude 桌面应用
- 确认聊天模式切换到 Cowork(不是 Chat)
- 点击输入框左下角 + 按钮
- 选择 Record a skill
- 首次使用需要授予屏幕录制和音频录制权限
- 选择麦克风后点击 Start Recording 开始录制
- 录制时避免在屏幕上显示密码、密钥等敏感信息
- 完成后停止录制,等待 Claude 分析
- 保存 Skill,之后通过斜杠命令(
/)调用
建议录制前关闭所有无关标签页,先预演一遍完整流程,找一个安静的环境确保语音讲解清晰。如果中途出错,可以丢弃重录。
竞争格局
Record a Skill 并非孤例。OpenAI 的 Codex 也在 2026 年推出了类似的 "Record & Replay" 功能,采用相同的意图级录制架构:通过语言模型而非规则引擎实现操作泛化,使录制的 Skill 能容忍小幅 UI 变化。两者的技术路线高度趋同,都验证了"演示优于指令"(demonstration over instruction)这一方向。
差异在于生态定位。Claude 的 Skill 体系与 Cowork 的 Computer Use 能力深度绑定,强调在桌面端的跨应用操作。OpenAI 的 Record & Replay 则更侧重于 Agent 平台的开放性和可移植性。对用户来说,选择哪个平台很大程度上取决于已有的工作流环境。
无论选择哪个平台,"录制一次即可自动化"正在从概念变为现实。这个方向上最大的不确定性不在技术能力,而在治理框架:当普通 WiFi 信号都能感知人的存在,当一次屏幕录制就能捕获你的完整工作流程,谁来定义"可感知"的边界,谁来设定"可录制"的红线,这些问题最终需要法律和制度层面的回答。
- Anthropic 洽谈由三星代工自研 AI 芯片7/2/2026
- Anthropic 获美国政府批准,恢复 Mythos 5 模型对关键基础设施组织的部署6/27/2026
- 美国政府要求 OpenAI 分阶段发布 GPT-5.66/26/2026
- 华为开源 920 亿参数 openPangu-2.0-Flash 模型6/30/2026
- 腾讯玄武阿图因AI在CyberGym测试中超越Mythos7/3/2026
- Gemini Omni Flash 登顶 Video Arena 盲测榜,领先第二名 101 分7/3/2026
- Claude Code 被指通过 system prompt 隐蔽传递代理与时区信息6/30/2026
- DeepSeek 联合北大开源 DSpark:半自回归推测解码,推理速度提升 57% 至 85%6/27/2026
- 华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码7/20/2026
- Cursor 研究:越强的 AI 模型越会"作弊"应对编程基准测试6/26/2026
- Hallmark:一份写给AI编码助手的反AI味设计手册7/17/2026
- Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成7/19/2026
- OmniRoute:日增 1300+ Star 的开源 AI 网关,一个端点接通 250 个模型提供商7/20/2026
- 苹果首款触屏 MacBook 确认搭载 M5 Pro/Max,M7 版计划 2027 年跟进6/27/2026
- 27B 模型塞进手机:PrismML Bonsai 27B 把权重压到 1-bit7/18/2026
- 6.4 万 Star 的开源全球情报平台:World Monitor 架构与能力全景7/21/2026
- KTransformers:单 GPU 跑 671B MoE 模型的清华方案7/21/2026
- Qwen-Image-3.0 发布:追求实用的图像生成7/21/2026
- Kimi K3:2.8万亿参数开源模型,前端编程Arena登顶7/17/2026
- Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺7/19/2026
- GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口7/19/2026
- jcode:用 Rust 重写的 AI 编码代理,内存占用仅为 Claude Code 的 1/147/22/2026
- AI 代码审查的 token 困境:code-review-graph 如何用代码图谱砍掉 98% 的上下文7/20/2026
- Gemini 3.6 Flash 发布:Token 效率砍 65%,多模态全面领先7/21/2026
- B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴7/18/2026
- Kimi K3 首登 DeepSWE v1.1:开源权重模型挤进前三7/18/2026
- AI 连破三大数学猜想:Jacobian 猜想 87 年反例与形式化验证的新时代7/21/2026
- 2026 年 AI 都学会了记忆,但你的记忆不属于你7/19/2026
- Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS7/18/2026
- LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧7/18/2026