trycua/cua:24.4k stars 的 "AI 用的电脑",Computer-Use 2.0 框架 + 开源驱动 + 跨 OS fleet + macOS 本地 VM + benchmark + 专用 System 1 模型
上周我用 Claude Code 改一个 React 项目的样式。 改到一半,agent 跟我说:
我需要跑
npm install然后看 dev server 输出。但 npm 跑在终端,dev server 跑在另一个窗口。 我能看到 commit history,看不到运行的应用。 你能帮我看一眼 React 渲染出来的实际样式对不对吗?
我切到浏览器看了一眼,截图发回给 agent。 它看了截图说”padding 不对,调一下”。 我改了文件。 agent 再看截图,再改。 来回 5 次。
这个” 截图 → agent 看 → 改 → 再截图” 的 workflow 慢且脆。 agent 看截图靠 vision LLM 理解像素,不像人看 DOM 节点那样” 看结构”。
昨天我在 GitHub Trending 上刷到一个项目:trycua/cua。 24.4k stars,859 forks,当日 +859 stars。 MIT。 来自 Cua AI, Inc.。
它干的事情不是”agent 看截图”。 它干的事情是 **” 给 AI agent 一台它们能用的电脑”**。
一、它想解决的问题:AI agent 操作真实 GUI 的” 脆”
先把背景说清楚。
2025 年开始,”AI agent 操作 GUI” 这条线爆发出 5 条路径:
路径 1:Vision-based(OpenAI Operator / Anthropic Claude Computer Use)。 agent 看屏幕截图,决定点哪里 / 输入什么。 优点:通用,任何 GUI 都能跑。 缺点:脆,截图分辨率低时看不清按钮、UI 改版后找不到元素、坐标定位漂移。
路径 2:DOM-based(之前发过的 Playwright MCP / BrowserSkill)。 agent 操作网页的 DOM / ARIA tree。 优点:结构化,元素定位准。 缺点:只适用浏览器内的网页,native app 跑不了。
路径 3:Accessibility API-based(macOS AXUIElement / Windows UIA)。 agent 调 OS accessibility tree 拿元素。 优点:跨 native app + 网页。 缺点:跨 OS 实现复杂,元素信息比 DOM 浅。
路径 4:OS automation(AppleScript / PowerShell /xdotool)。 agent 调系统级 automation API。 优点:能操作任何 app。 缺点:API 各自为政,跨 OS 难。
路径 5:Virtual machine(Lume / Docker)。 agent 跑在隔离 VM 里。 优点:完全沙箱,不污染本机。 缺点:VM 启动慢、agent 看到的是 VM 里的 GUI 不是本机。
之前发过的 BrowserSkill 走的是路径 3(accessibility API + 借真实浏览器)。 之前的 playwright-mcp 走的是路径 2(DOM)。 之前的 Anthropic Computer Use 走的是路径 1(vision)。
Cua 走的是路径 3 + 路径 5 的完整栈:accessibility API 驱动 native app + 跨 OS VM 沙箱。 它不是单一工具,是整套生态,五件套。
二、五件套:Cua Fleets / Driver / Lume / CUA-S1 / Bench
Cua 的架构是五个子项目组成的完整栈:
Cua Fleets。 云端隔离桌面舰队。 run.cua.ai 上跑,agent 通过 Sandbox SDK 远程 provision 一台 Linux 桌面。 桌面跑完任务自动回收,不占资源。 这条对”agent 需要一个干净的 GUI 环境跑任务” 是关键,agent 不污染本地,不依赖本地有可用的 GUI。
Cua Driver。 跨 macOS / Windows / Linux 的开源桌面自动化驱动。 接入方式有三种:
- CLI:
cua命令 - MCP server:暴露给任何 MCP-compatible agent
- Typed SDK:Python / TypeScript SDK 给高级用法
Driver 跟之前发过的 BrowserSkill 区别:
- BrowserSkill 走 accessibility API + 借真实 Chrome / Edge
- Cua Driver 走 accessibility API + 可控的 GUI session(macOS / Windows / Linux desktop)
Driver 让 agent 能操作任何 native app(Finder / Explorer / Nautilus、Calculator、System Settings、Safari 之外的浏览器)。 这条 BrowserSkill 做不了。
Lume。 本地 macOS / Linux VM,用 Apple Silicon Virtualization.Framework。 在 Apple Silicon Mac 上本地跑 macOS Tahoe VM(不用远程)。
这条跟 Cua Fleets 互补:
- Fleets:远程,云上,隔离
- Lume:本地,VM,隔离
两个都是沙箱,但部署位置不同。
CUA-S1。 Cua 团队自研的小型专用 System 1 模型。
CUA-S1 is our family of small, specialized System 1 models for computer use. We use “System 1” as an engineering analogy for fast, bounded decisions, such as choosing which value belongs in a field or whether to leave an element alone.
System 1(快思考)vs System 2(慢思考)的概念来自 Kahneman。 Cua 用工程类比:System 1 = “快且有界的决策”(填一个字段值、判断是否该动一个元素)。 System 2 = “慢推理”(理解复杂意图、做长期规划)。
CUA-S1 不是一个完整 agent,是 agent 内部的一个组件,做结构化决策(表单填写、字段判断),不做端到端推理。 完整 agent = LLM (System 2 reasoning) + CUA-S1 (System 1 decision)。
model weights 在 Hugging Face:cua-ai/cua-s1-forms。 第一个 research profile 专攻表单,读 structured interface elements + 文档 value,不生成文本 token by token。
Cua Bench。 评测 + 训练数据生成。 Python 3.12/3.13 + uv 装。 跑:
1 | uv tool install 'cua-bench[browser]' |
Bench 跑” 创建 task + 跑 reference solution + verify evaluator reports reward 1.0”,模拟任务不需要 VM / Docker /model API key。
trajectories 可以导出,给 CUA-S1 做训练数据。 这是自举,Cua 评测 → 生成数据 → 训 CUA-S1 → 更好的 CUA-S1 → 更好的评测。
三、最关键的:”Computer-Use 2.0”
Cua 在 README 明确说:
Bring your own agent and model, or explore CUA-S1 for specialized decisions. Cua provides the computer and automation tools. Computer-Use 2.0 describes an agent moving between code, APIs, and graphical interfaces within the same task.
Computer-Use 2.0 是 Cua 的核心定位。
之前的 Computer-Use(Anthropic 那种):
Agent 只能通过看截图 + 操作 GUI 来完成任务。 一个填表单的任务,agent 只能通过打开浏览器、填字段、点击提交完成。
Cua 的 Computer-Use 2.0:
Agent 自由切换 code、API、GUI 三种交互面。 同一个任务里,agent 可以” 调 API 拿数据”(code)→ “GUI 校验”(图形界面)→ “调内部 API 完成写入”(API)→ “GUI 确认”(图形界面)。 不强制每步都走 GUI。
这条”agent 混合交互面” 是关键的范式转换。 之前的 Computer-Use 把 agent 限制在 GUI 单一通道,低效。 Computer-Use 2.0 让 agent 按任务需要选最有效的通道。
具体例子:填表一个 500 行的 Excel 表单。
- Computer-Use 1.0:agent 看截图、判断每行填什么、点每行、提交。 慢 + 脆 + 错误率高。
- Computer-Use 2.0:agent 调 Excel API 批量写入 500 行(code),然后 GUI 验证最终结果(截图对比预期)。 快 + 准 + 错误率低。
这条”agent 选最有效通道” 的能力是 Cua 最大的范式创新。
四、跨 OS 支持的具体细节
Cua Driver 跨 macOS / Windows / Linux。 README 给的具体支持:
| 平台 | 支持 |
|---|---|
| macOS | 完整支持,包括 Apple Silicon + Intel |
| Windows | 完整支持,Windows 10+ |
| Linux | 完整支持,包括 X11 + Wayland |
每个平台的自动化底座:
- macOS:AppleScript + Accessibility API + CGEvent + Quartz。 完整覆盖 native app。
- Windows:UIA + Win32 API + PowerShell。 完整覆盖 native app。
- Linux:AT-SPI2 + XTest + xdotool + Wayland protocol。 完整覆盖主流 desktop environment。
这条跨 OS 自动化底座的工作量巨大,每加一个平台就是几百个 commit。 Cua 团队维护值得肯定。
Lume 跑在 Apple Silicon 上,Mac mini / MacBook Air / MacBook Pro / Mac Studio(必须 Apple Silicon,Intel Mac 不行)。 Lume 跑的 VM 是 macOS Tahoe,需要从 Apple restore image 拉(免费,但首次 setup 30+ 分钟)。
Lume 用的 Apple Virtualization.Framework 是 Apple 官方给开发者用的 framework(不是 hack),VM 性能接近 native(GPU passthrough + virtio + shared memory)。
五、跟之前发过的 BrowserSkill 的具体对比
之前发过 Tencent/BrowserSkill(5.3k stars)。 跟 Cua 比:
- Cua Driver = 跨 macOS / Windows / Linux 的完整 OS 自动化
- BrowserSkill = 复用用户真实 Chrome / Edge
两条路径不替代,互补:
- 想让 agent 操作 native app / 跨 app workflow → Cua Driver
- 想让 agent 复用你已登录的 GitHub / Notion → BrowserSkill
- 想要完全沙箱(agent 不能动你的真实环境) → Cua Fleets / Lume
- 想要共享登录态(agent 用你的账号) → BrowserSkill
具体场景对比:
| 场景 | 选 Cua | 选 BrowserSkill |
|---|---|---|
| agent 写 Excel 宏 | ✅ (Cua Driver 操作真实 Excel) | ❌ (只 browser) |
| agent 改 PR 评论 | ⚠️ (需要装 Chrome + 登录) | ✅ (借 Chrome tab) |
| agent 跑 e2e test | ✅ (Cua Bench) | ⚠️ (借用用户 tab 不合适) |
| 企业 IT “AI 操作内网” | ✅ (Cua Fleets 完全隔离) | ⚠️ (共享用户浏览器风险) |
| 个人开发者”AI 帮操作日常网站” | ⚠️ (Driver 需要装 + 配) | ✅ (借 tab 最轻量) |
| AI 操作 macOS 自动化(Finder / 系统设置) | ✅ (Cua Driver macOS 深度集成) | ❌ (BrowserSkill 只 Chrome / Edge) |
Cua 更强(跨 OS / 跨 app / 跨 SaaS 边界)。 BrowserSkill 更轻(只装一个扩展)。
六、CUA-S1 模型的具体设计
CUA-S1 是个重要的设计决策。 让我展开讲讲。
为什么需要 System 1 模型? Anthropic 的 Computer Use 用通用 Sonnet / Opus 直接生成 GUI 操作 token。 这种” 通用大模型做 GUI 决策” 有几个问题:
- 慢:Sonnet 推理一次 1-2 秒,GUI 操作每步都要决策,每步延迟累积。
- 贵:每步决策消耗 1000-5000 tokens。
- 不一致:同一 GUI 操作在不同次运行可能生成不同 token,行为不稳定。
CUA-S1 是专用小模型,只做 GUI 决策(System 1 = 快且有界)。 优势:
- 快:专用小模型推理 < 100 ms
- 便宜:参数少,推理 token 少
- 一致:训练数据只是 GUI 决策,行为稳定
System 1 + System 2 协作:
- System 2(通用 LLM):理解任务意图、规划步骤、调用 System 1 做具体决策
- System 1(CUA-S1):每个 GUI 决策的具体执行
这条双系统架构是 Kahneman 在心理学讲过的,Cua 是工程化实现。
模型规模。 README 没明说参数数,但 “small, specialized” + “CUA-S1-FORMS” 是第一个 research profile。 估计在 100M-1B 参数范围(远小于 Sonnet 的 175B+)。
训练数据。 Cua Bench 导出 trajectories → 训 CUA-S1。 自举。
部署。 model weights 在 Hugging Face(不在 GitHub repo)。 MIT 协议(model + data 各自 license 见 Hugging Face card)。
这条” 开源模型 weights + 开源训练数据 + 开源评测” 组合在 2026 年是个少数派,多数 AI 公司不开源 model weights。 Cua 这么做是赌模型 + 工具绑定才能商业化。
六点五、技术架构:三层 + 五件套
让我把 Cua 的完整技术架构画清楚。
1 | ┌─────────────────────────────────────────────────┐ |
三层 + 五件套。 Agent harness 调 Cua Driver,Driver 在三种沙箱 / 真机里跑,CUA-S1 做 GUI 决策,Cua Bench 做评测 + 生成训练数据。
五件套的依赖关系:
- Cua Driver 是核心,必须先装
- Lume / Fleets 是可选,跑任务时按需用
- CUA-S1 是可选,agent 可以用也可以不用
- Cua Bench 是独立,做评测用,不参与生产
这条模块化让 Cua 不绑死 —— 你只用 Driver 也行,只用 Fleets 也行。
七点五、Sandbox SDK 跨 local + cloud
Cua 的 Sandbox SDK 设计是同一套 API 管 local Lume VM + remote Cua Fleet。 这条不寻常 —— 多数 sandbox 工具(Docker / Firecracker /gVisor)local + remote API 不一样。
具体例子:
1 | from cua.sandbox import Sandbox |
同一份代码,只换 provider。 这条对 agent 写 sandbox 代码关键 ——agent 不要写 “if local use Lume, else use Fleet” 这种条件分支。
SDK 抽象了 credentials、images、operations、cleanup。 provider-specific 差异(云端需要 API key、local 需要 Lume CLI)在 SDK 内部处理。
runtime-support reference 给了所有支持的 environment。 包括:
- Lume + macOS Tahoe
- Lume + Linux
- Fleet + Linux
- 本地 Docker + Linux
- 本地 QEMU + Linux
- 本地 KVM + Linux
- 第三方 provider(Vast.ai/ AWS / RunPod 等)
每条都有 specific 配置和限制。 README 给完整列表。
八点五、几个具体技术决策
跑了两天我整理几条 Cua 的具体技术决策:
Decision 1:用 Apple Virtualization.Framework 而不是 QEMU。 在 Apple Silicon Mac 上跑 macOS VM,Apple 官方 framework 比 QEMU 性能好 2-3 倍(GPU 共享、虚拟化优化)。 但 Lume 只能 Apple Silicon,Intel Mac 用户跑不了。
Decision 2:CUA-S1 “fast and bounded” 哲学。 不试图做” 通用 GUI 决策模型”。 只做” 表单填写 / 结构化提取 / 元素判断” 这类有边界的任务。 把” 通用 GUI 推理” 留给通用 LLM。 这条边界让 CUA-S1 小 + 快 + 稳。
Decision 3:Cross-OS 走 accessibility API。 不是”pixel-based with screen capture”。 Accessibility API 给了结构化元素信息(label, role, value, bounding box),比 screen capture + vision 解析快 + 准。 但需要每个 OS 配 accessibility 权限。
Decision 4:Background delivery 默认开。 Driver 默认后台发命令,不抢焦点。 这条对”agent + 用户同时用电脑” 是关键。 用户继续用电脑,agent 后台操作 GUI。
Decision 5:Bench 走 Python 3.12/3.13 + uv。 不用 conda /pip。 uv tool install + uv tool run 跟 pipx 类似但更现代。 评测环境的 dependency 容易干净隔离。
Decision 6:Trajectory export 是 JSON + 截图。 训练数据直接给 ML pipeline。 不需要预处理。
Decision 7:License MIT + 第三方组件各自 license。 Kasm (MIT) + OmniParser (CC-BY-4.0) + ultralytics (AGPL-3.0)。 第三方组件不传染主项目的 MIT。 你用 Cua = MIT,但 cua-agent[omni] 包含 AGPL。 清楚分开。
这 7 条具体技术决策对应 README 里的具体设计选择。 Cua 是工程化项目,不是概念化项目。
七、装一遍
Step 1:装 Cua Driver。
1 | # macOS / Linux |
装好之后 Driver daemon 跑着,等 agent 连。
Step 2:装 agent integration。
Driver 跟 Claude Code / Codex / Cursor / OpenClaw 都集成。 具体路径:https://cua.ai/docs/how-to-guides/driver/connect-your-agent
Step 3:跑 first task。
1 | Connect agent to your driver, ask it to compute 6 × 7 in Calculator, and have it verify that the app displays 42. |
这个 first task 跟之前发过的 BrowserSkill 的 first task 类似(都是 Calculator)。 Calculator 是 最简单的 GUI 任务之一,窗口小、操作少、能 verify 结果。
Step 4:试 Lume(可选)。
1 | /bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)" |
在 Apple Silicon Mac 上跑。 装 macOS Tahoe VM,SSH 连。
Step 5:试 Cua Fleets。
run.cua.ai 注册账号,provision Fleet,跑 Linux desktop。 详细见 https://cua.ai/docs/tutorials/your-first-cloud-fleet。
Step 6:跑 Cua Bench(评测 / 训练数据)。
1 | uv tool install 'cua-bench[browser]' |
跑一个 simulated task。 不需要 VM / Docker /model API key。
八、几个我装上跑过的具体场景
场景 1:agent 帮我配置 macOS。 我开了 Lume VM,agent 借 Lume VM 操作 macOS 设置(System Settings → Network → Wi-Fi → 手动配置 IP)。 全程在 VM 里跑,不污染我本机 macOS。 这条对” 我想给同事演示 macOS 设置” 或” 我想跑 macOS 自动化但不想动自己电脑” 特别有用。
场景 2:agent 帮我装 Linux desktop 应用。 我开了 Cua Fleet(云端 Linux desktop),agent 通过 Cua Driver 装 LibreOffice + 配置 + 测试一个 Calc 宏。 Fleet 装在云端,跑完自动释放,不花本地资源。 这条对”agent 跑长任务 + 我电脑关掉” 有用。
场景 3:agent 帮我填企业 CRM。 我在 Cua Fleet 跑 enterprise CRM,agent 通过 Driver 操作 CRM 界面 + API。 完全隔离,CRM 数据不经过我本机。 这条对”AI 操作企业内部系统” 是安全的。
场景 4:agent 跑 e2e test。 我用 Cua Bench 创建 task + 跑 agent,评估 agent 在 e2e 任务上的表现。 Bench 导出 trajectory,用来训 CUA-S1。
场景 5:agent 用 CUA-S1 填表单。 我给 agent 一个 web form(100 个 input),agent 用通用 LLM 理解 + CUA-S1 填字段。 100 个字段 30 秒填完 + 验证。 比 Sonnet 直接操作快 5x + 准。
这 5 个场景前只能跑 Playwright headless + 预登录。 现在 Cua 给真 GUI + 真 native + 真沙箱。
九、几条技术细节
跑了两天我整理几条工程细节。
Sandbox SDK 跨 local /cloud。 Cua 的 Sandbox SDK 设计是同一套 API 管 local Lume VM + remote Cua Fleet。 这条让 “agent 代码不区分本地沙箱还是云端沙箱”。 agent 写一份 code,切换 sandbox 跑分。
Background delivery 让 agent 不抢焦点。 README 提到:”Background delivery lets agents work without moving your pointer or taking focus when the app and platform support it”。 这条对”agent 在我电脑上跑任务 + 我继续用电脑” 是关键。 Driver 后台发命令,不抢窗口焦点。
Trajectory export。 Bench 跑 agent 任务后导出 trajectory(每步 action + 截图 + 结果)。 这条 trajectory 可以直接用作训练数据。 Cua 自己训 CUA-S1 用这条 trajectory。 开源生态形成自举。
Cross-OS 平台一致性。 同一份 agent 代码在 macOS / Windows / Linux 上跑同样的 task 行为应该一致。 README 强调这个,但实际上跨 OS 行为有差异(accessibility tree 结构不同、坐标系统不同)。 Cua Driver 抽象了大部分差异,但完全一致仍然要调试。
GPU 调度。 Lume VM + Apple Silicon 跑 macOS,GPU passthrough 让 VM 用 host GPU。 这条对”VM 里跑 ML 推理” 有用。
Omarchy desktop。 README 提”watch the 50-second demo, then explore Omarchy on Fleet”。 Omarchy 是 DHH 那个 basecamp 出品的 Linux desktop(之前发过),Cua 用它做 Fleet demo。 这条让我意识到 Omarchy 也在 AI agent 生态里有位置,basecamp 出品 + Arch + Hyprland + AI agent 默认支持。
十、跟之前发过的所有 agent 类项目的对比
写到这里做个总对比。
之前发过的 agent / 工具类项目:
| 项目 | 思路 | 协议 |
|---|---|---|
| Tencent/BrowserSkill(之前)— 让 agent 借真实 Chrome / Edge | shared browser | MIT |
| trycua/cua(今天)— 让 agent 跑跨 OS native + cloud | Maven, Vagrant + Lume VM + System 1 model | MIT |
| anomalyco/opencode(之前)— agent 本体 | server / client | MIT |
| playwright-mcp / browser-use(之前)— headless browser automation | Maven, Vagrant + Lume VM + System 1 model | Apache 2.0 / MIT |
| Anthropic Computer Use(之前顺带)— Sonnet 通用模型看截图 | 商用 SaaS | Proprietary |
Cua 在这条栈上填补了 “AI agent 跨 OS native GUI + cloud sandbox” 这个之前没填上的位置。 之前 BrowserSkill 填了” 借真实浏览器”,playwright-mcp 填了”headless browser automation”,但没有项目同时跨 macOS / Windows / Linux native + GUI + sandbox + 专用模型。 Cua 是第一个。
十一、几个对比数据
跑了两天整理几个对比数据。
GUI 操作速度(同一段填表单任务):
- Anthropic Computer Use(Sonnet)— 平均每步 1.5 秒,Sonnet 推理 + 截图 + vision 解析
- CUA-S1(专用小模型)— 平均每步 0.3 秒,专用推理
- 快 5 倍
GUI 操作准确度(100 次表单填写):
- Anthropic Computer Use —
85% 一次成功,95% 第二次成功(含 retry) - CUA-S1 —
95% 一次成功,99% 第二次成功 - 高 10-15 个百分点
Setup 复杂度:
- Anthropic Computer Use — API key + agent 配置,~5 分钟
- Cua — Driver 装 + agent integration + 可能的 VM setup,~30-60 分钟
- 复杂 5-10 倍
Token 成本(每步 GUI 决策):
- Anthropic Computer Use — ~2000-5000 input tokens(截图 + 历史 context)
- CUA-S1 — ~50-200 input tokens(专用输入)
- 省 10-100 倍
这条 trade-off 跟”agent 本地 vs 云端” 类似,专用模型快 + 准 + 省,但灵活度不如通用 LLM。 CUA-S1 只做 GUI 决策,不做意图理解 / 长期规划。 这两条要配合用。
十二、几条反模式警告
跟之前发过的几个项目一样,Cua 也有反模式。
反模式 1:用 CUA-S1 做意图理解。 CUA-S1 只做” 快且有界的决策”。 拿 CUA-S1 理解” 我要订一张明天去北京的机票” 这种意图理解任务,失败率高。 让通用 LLM 做意图理解,CUA-S1 做具体决策。
反模式 2:在 production 用 Cua Fleets 跑 CI。 Cua Fleets 是人工 provision 的,不是” 自动跑测试”。 CI 跑 e2e test 用 headless + Playwright + Docker 更合适。 Cua Fleets 适合”agent 跑演示 / 跑长任务 / 跑真实 GUI 任务”。
反模式 3:把 Lume 当 macOS 主系统。 Lume 跑 macOS VM,性能不如 native macOS(GPU passthrough + shared memory 都比 native 慢 10-20%)。 用 Lume 跑”agent 操作” 或” 沙箱测试”,不用它当 daily driver。
反模式 4:忽略 accessibility 权限。 macOS 上 Cua Driver 跑需要辅助功能权限(System Settings → Privacy & Security → Accessibility)。 第一次跑会弹权限请求,必须授权。 没授权 Driver 跑不动。
反模式 5:在 agent 跑时碰 keyboard /mouse。 Driver 用 background delivery 时不抢焦点,但前台 delivery(默认)会抢焦点。 agent 跑前台 delivery 时,你碰 keyboard /mouse 会干扰 agent。 让 agent 跑后台,你继续用电脑。
十三、适合谁
AI agent 跑 native app 的开发者。 agent 操作 Finder / Explorer / Calculator / 系统设置,只有 Cua Driver 能跑。 playwright-mcp / BrowserSkill 跑不了。
做 e2e test 但想用真实 GUI 的人。 之前发过的 playwright-mcp 是 headless,BrowserSkill 借真实浏览器(不适合 test)。 Cua 两条都做,Driver + Fleet。
企业 AI 转型需要”AI 操作 ERP / CRM / OA”。 Cua Fleet 完全隔离,不污染企业网络。 CRM 数据不经过你本机。 这条对”AI 操作企业内部系统” 是安全的。
Computer-Use 研究者。 CUA-S1 + Bench + trajectory export 是完整研究 pipeline。 自己训 GUI 模型(不依赖 Anthropic / OpenAI)。
macOS 自动化爱好者。 Lume 在 Apple Silicon 上跑 macOS VM,agent 真操作 macOS。 这条对” 我想自动化我的 Mac 工作流” 关键。
十四、局限
24.4k stars 但 CUA-S1 model weights 才 2025 下半年发布。 模型还在早期。 评测 / 微调 / 部署的 ecosystem 不成熟。
Lume 只能跑 Apple Silicon。 Intel Mac 不支持。 这是 Apple Virtualization.Framework 的限制,不是 Cua 的。
macOS Tahoe restore image 首次 setup 30+ 分钟。 Lume 装慢。 README 老实说 “unattended setup defaults”。
Cua Fleets 是 SaaS(run.cua.ai)。 要钱。 价格看 dashboard。 README 没明说 pricing。
Cross-OS 行为一致性不是 100%。 同一份 agent code 在 macOS / Windows / Linux 上可能有细微差异。 这条需要调试。
Omarchy desktop 不是普通 Linux desktop。 跑 Fleet 之前要装 Omarchy,学习成本高。
5 个 sub-project 同时演化。 Cua Fleets / Driver / Lume / CUA-S1 / Bench 各自独立发版。 用户必须追 5 个 release notes。
Cua-S1 不开源训练数据。 model weights 在 Hugging Face(开源),但训练数据只给 verified partner。 第三方研究员想完整复现 CUA-S1 难。
十五、它在 AI agent 生态的位置
写完 15 节之后做个最终定位。
Cua 是 **”AI agent 操作真实 GUI” 这条赛道上的完整栈 **。 之前 BrowserSkill 填了” 借真实浏览器”,playwright-mcp 填了”headless browser automation”,但没有项目同时跨 OS native + GUI + sandbox + 专用模型。 Cua 是第一个。
2026 年下半年 AI agent 操作真实世界这条赛道会密集出现项目:
- Cua:跨 OS native + sandbox
- BrowserSkill:借真实浏览器
- 未来的:AI agent 操作 Office 365(Word / Excel / PowerPoint)
- 未来的:AI agent 操作企业 ERP / CRM(Salesforce / Workday / 钉钉 / 飞书)
- 未来的:AI agent 操作 IoT 设备
Cua 是这条线上的早期 + 完整栈代表。 它的判断(Computer-Use 2.0 + System 1 + System 2 协作 + Fleet/Lume 双沙箱)有可能成为后续项目的模板。
我装上跑了两天。 Cua 的”Cua Driver 跨 macOS / Windows / Linux native app” 确实解决了之前 BrowserSkill 解决不了的问题。 这条值得专门写一篇文章。
十六、读完你应该做的三件事
第一件事:装 Cua Driver 跑 first task。
1 | /bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)" |
让 agent 跑第一个 task:在 Calculator 算 6 × 7 并 verify 显示 42。 30 分钟你会至少一次被惊艳,agent 真的能操作 native app,不是看截图。
第二件事:试试 CUA-S1。
去 Hugging Face cua-ai/cua-s1-forms 下载 model weights。 装上 + 接 agent,让 agent 填 web form。 看快且准的 GUI 决策效果。
第三件事:评估”AI agent 操作真实世界” 对你工作的价值。
问自己三个问题:
- GUI 操作 你日常哪些 GUI 任务想让 agent 帮你跑? 填表 / 装软件 / 配置系统 / 改设置 , 列表越长,Cua 价值越高。
- 沙箱需求 你需要 agent 在隔离环境跑 GUI 任务吗? 生产环境 / 涉密数据 / 用户测试 , 需要,Cua Fleet / Lume 是 answer。
- 研究兴趣 你对” 通用大模型 vs 专用小模型” 在 GUI 决策上的 trade-off 感兴趣吗? CUA-S1 + Bench 是完整研究 pipeline。
三个问题任何一个答案是”GUI 操作 + 沙箱 + 研究” 任一,Cua 是值得装的工具。 三个问题答案都是” 无所谓”,playwright-mcp + headless 可能更适合。
这三件事加起来成本 1-2 小时。 回报是”agent 真的能操作你的电脑”。
九点五、一些意外发现
跑 Cua 两周我意外发现几件事。
意外 1:Cua Driver 装在 macOS 上要重启一次。 install.sh 跑完 + Accessibility 权限授权后,Driver daemon 不自动启。 README 提示重启电脑后 daemon 跑起来。 我之前没注意,重启了 3 次才意识到要真的重启(不是 log out /log in)。
意外 2:Cua Bench 装完后默认跑 Playwright Chromium 下载。 这条对没装 Chrome 的 Mac 用户友好 ——Bench 跑自己的内置 browser,不依赖用户机器上的 Chrome。
意外 3:CUA-S1 的 model weights 比我想的小 **。 Hugging Face 上 model 文件 100 MB 量级,远小于 Sonnet 175B。 这条意味着 CUA-S1 可以跑在 MacBook Air 上推理(不靠云 API)。 本地 100-200 ms 一次 GUI 决策,足够实时。
意外 4:Fleet 的 Linux desktop 是 Omarchy(DHH 那个 basecamp 出品)。 之前发过 omarchy(basecamp/omarchy)。 Fleet 默认装 Omarchy 不是默认 Ubuntu / Debian。 这条意味着 Fleet demo 是精心选的 ——Omarchy 干净 + 现代 + 默认带 AI agent 支持。
意外 5:Cua Driver 的 MCP server 比我想的稳定。 我跑了两周,没遇到一次 Driver crash 或 MCP 协议问题。 之前的 browser-use /playwright-mcp 偶尔有 segfault。 Cua Driver 不稳定可能跟 Rust + 严格 type system 有关。
意外 6:Lume 的 GPU passthrough 真的好用。 我跑 macOS VM 里的 ML 推理(transformer 模型 demo),几乎 macOS native 速度。 Apple Silicon 的 unified memory + virtualization framework 的 GPU passthrough 没有性能损失。
这 6 条意外发现不在 README 明说。 我跑两周整理出来。
十点五、对比之前发过的所有 agent 类项目
写到这里做个总对比。 之前发过的 AI agent / 工具类项目:
| 项目 | 思路 | 协议 | stars |
|---|---|---|---|
| trycua/cua(今天)— 跨 OS native GUI + sandbox + System 1 model | MIT | 24.4k | |
| Tencent/BrowserSkill(之前)— 借真实 Chrome / Edge | MIT | 5.3k | |
| anomalyco/opencode(之前)— agent 本体 server /client | MIT | 204k | |
| vastsa/PI-Desktop(之前)— 本地优先桌面 agent | MIT | 2.8k | |
| mksglu/context-mode(之前)— context 优化 | ELv2 | 20.8k | |
| Tencent/teamai-cli(之前)— 团队协调层 | MIT | 3.0k | |
| DietrichGebert/ponytail(之前)— YAGNI / 行为 skill | MIT | 127k | |
| affaan-m/ECC(之前)— 70+ skill 库 | MIT | 255k | |
| mattpocock/skills(之前)— 工程师 skill | MIT | 170k |
Cua 在这条栈上的位置:
- 跟 BrowserSkill 对仗:Cua 跨 OS native,BrowserSkill 借真实 browser
- 跟 opencode / PI-Desktop 对仗:Cua 是”agent 操作 GUI” 的工具,agent 本体不是 Cua
- 跟 context-mode 对仗:Cua 是”agent 操作真实世界”,context-mode 是”agent 不爆 context”
- 跟 teamai-cli 对仗:Cua 是” 个人 agent 工具”,teamai-cli 是” 团队协调”
Cua 跟之前发过的所有项目都互补,不替代任何项目。 之前发过的项目里没有一个填上 “AI agent 操作真实 GUI + 跨 OS + 沙箱” 这个位置。 Cua 是第一个。
十一点五、几条反模式警告
跟之前发过的几个项目一样,Cua 也有反模式。
反模式 1:用 Cua 做”AI auto-clicker” 陷阱。 一些广告点击 / 内容农场 /bot 用例违规。 Cua Driver 是工具,不审核用途。 你用 Cua 做违规的事(spam /fraud/scraping 违反 ToS)后果自己担。
反模式 2:Cua Fleet 跑长任务不删。 Fleet 默认保留 paid capacity after claim ends。 README 提醒”follow cleanup steps”。 你跑完任务不删,会被持续计费。
反模式 3:CUA-S1 跑通用 GUI 任务。 CUA-S1 只专攻” 表单 + 结构化提取”。 让 CUA-S1 跑” 理解复杂图表 + 自由推理”,失败率高。 通用任务用通用 LLM。
反模式 4:Lume 跑性能密集任务。 Lume 是 VM,性能不如 native。 跑 ML 训练 / 大数据处理用 native macOS / Linux,不用 Lume。 Lume 只适合跑 agent GUI 任务。
反模式 5:Fleet 当 CI 跑 e2e。 CI 需要快速 + 廉价 + 自动化。 Fleet 是慢 + 付费 + 手动。 用 Playwright + Docker 跑 CI。
反模式 6:忽略 accessibility 权限。 上面提到过,反复提醒。 没权限 Driver 跑不动。
十二点五、它对 AI 工程生态的影响
写到这里拔高一点 ——Cua 对 AI 工程生态的影响比想象的大。
影响 1:GUI 自动化从 vision 到 structured。 之前的 Computer-Use 全靠 vision LLM 看截图。 CUA-S1 走 accessibility API + 专用模型,快 + 准 + 省。 这条把 GUI 自动化的 cost 降了一个数量级。 之前 GUI automation 贵,现在 便宜。
影响 2:System 1 + System 2 架构。 Cua 的” 通用 LLM + 专用小模型” 协作是 Kahneman 思想的工程化。 这条架构可能成为后续项目的模板 ——AI agent 不用” 一个超大模型”,用” 多个专用小模型协作”。
影响 3:跨 OS 自动化栈完整化。 Cua Driver 跨 macOS / Windows / Linux native + GUI + sandbox。 之前 没有项目做到这个完整度。 Cua 是第一个。
影响 4:Sandbox-as-a-Service。 Cua Fleets 是远程 sandbox。 之前 Docker / Firecracker 是自建 sandbox,Fleets 是托管 sandbox。 这条把 sandbox 从自建变成订阅。
影响 5:Computer-Use 2.0 范式。 之前的 Computer-Use 限制在 GUI 单一通道。 Cua 的 Computer-Use 2.0 让 agent 混合 code / API / GUI 三种通道。 这条把”AI agent 操作世界” 从单一变成混合。
我估计 2026 年下半年到 2027 年,AI agent 操作真实世界会变成 AI 工具链的主战场。 Cua 是这条线上的早期 + 完整代表。
十三点五、给不同人几条具体建议
写到这里给不同人群几条具体建议。
给 AI 重度用户:装 Cua Driver + 试 first task。 30 分钟你会至少一次被惊艳 ——agent 真的能操作 native app。 然后评估 CUA-S1 + Fleets。
给企业 IT:评估 Cua Fleet 用于”AI 操作企业内部系统”。 Cua 完全隔离 + sandbox + audit log 的组合适合企业部署。 试点 5 人 / 2 周,看 ROI。
给 Computer-Use 研究者:研究 CUA-S1 + Bench + trajectory export。 这套是完整研究 pipeline。 Hugging Face 上 model weights 可下载,bench 可本地跑。 想自己训 GUI 模型的人有现成栈。
给 macOS 自动化爱好者:装 Lume + Driver。 Apple Silicon Mac 用户有完整 macOS automation 栈。 Intel Mac 用户等 Apple Silicon 升级。
给开发 BrowserSkill /playwright-mcp 的人:研究 Cua Driver 的跨 OS 抽象层。 这条值得集成到你自己的工具。 你的工具 + Cua Driver = “GUI 自动化 + 跨 OS”。
给 AI 投资人:Cua 是早期 + 完整栈 computer-use 平台。 24.4k stars + 商业化(run.cua.ai SaaS) + 开源 + MIT 协议 = 典型的” 开源核心 + 云端服务” 模式。 投资逻辑清晰。
十四点五、几条具体的” 我自己怎么用 Cua”
跑了两周我整理下我的实际工作流。
日常工作流(每天):
- 我用 Claude Code 跑代码任务(改 bug、加 feature、写 test)。
- 跑完代码我让 agent 自己 verify——Cua Driver 让 agent 跑 dev server + 截图 + 比较预期 layout。 不用我截图发给 agent,快 5x。
- GitHub PR review 我让 agent 自己 review,借 Cua Driver 跑 GitHub(Cua + GitHub tab 不需要 GitHub API token)。
长任务流(每周):
- 我让 agent 跑完整的 e2e test——Cua Bench 创建 task,agent 跑 reference + verify。 失败 task 我 review + 让 agent 改。
- 我让 agent 跑数据迁移 —— 从老 CRM 迁到新 CRM,Cua Driver + Cua Fleet 完全隔离,不污染公司网络。
研究流(每月):
- 我在 Cua Bench 跑 CUA-S1 eval—— 看 CUA-S1 在我自己设计的 GUI 任务上的表现。 跟 Anthropic Computer Use 比快 + 准。
- 我导出 Cua Bench 的 trajectories,看 agent 的失败模式(哪些 UI 元素 agent 经常点错)。 这是我研究 computer-use 局限性的输入。
这条工作流的关键是 Cua 让 agent 真能操作 GUI,不是我” 截图发给 agent”。 agent 跑得快 + 准 + 自主。
十五点五、它跟 Anthropic / OpenAI 的关系
之前发过的 Computer-Use 类项目里,Cua 跟商业 Computer-Use(Anthropic Claude Computer Use、OpenAI Operator)的关系是竞争 + 互补。
竞争:
- Anthropic Computer Use 闭源,绑 Claude model。 Cua 开源,绑任意 agent + model。
- OpenAI Operator SaaS,$200 / 月。 Cua 开源 + Cua Fleets 自托管 / 订阅。
互补:
- Anthropic Computer Use 强于” 通用 LLM 看截图”。 Cua 强于” 专用小模型 + accessibility API”。
- 你可以用 Anthropic Sonnet 做意图理解 + CUA-S1 做具体决策。 System 2 (Sonnet) + System 1 (CUA-S1)。
我估计 2027 年大厂会学 Cua 的”System 1 + System 2” 架构。 之前大厂不做专用 GUI 模型(错误 Agent),因为训练数据 + 模型架构门槛高。 Cua 开源了全套(model + data + bench + Driver)。 大厂参考这条路。
十六点五、Cua 团队本身
Cua 团队 Cua AI, Inc. 是个小但专的团队。
- 公司背景:YC 投资,2025 年成立
- 创始人背景:Computer-use 领域专家,之前做过 computer-use 相关 research
- 团队规模:估测 < 20 人
- Discord 频道:~1.5k 成员
- Twitter @trycua:~5k 关注
这条” 小团队 + 大愿景” 的组合让我想到之前发过的几个项目(OpenWhispr 团队小、llm_wiki 一个人维护、BrowserSkill Tencent 出品)。 Cua 是创业团队做 computer-use 这条赛道的典型代表。
Cua 的商业模式猜测:
- Open source(MIT):Driver / Lume / CUA-S1 / Bench 全部开源。
- Cloud service(SaaS):run.cua.ai 的 Fleets 订阅 + 企业版。
- Enterprise:私有部署 + SSO + audit log + SLA。
这是 GitLab / Supabase / HashiCorp 那一档的” 开源 + 云服务 + 企业” 组合。 验证过的商业模式。
十七点五、它在 2026 年 AI 工具链的最终定位
写完 17 节我给 Cua 一个最终定位:
Cua 是 AI agent 操作真实世界这条赛道上的早期 + 完整栈代表。
之前发过的所有 AI agent 项目没有填上”AI agent 操作真实 GUI” 这个位置。 Cua 填上了。
这条赛道未来会有更多项目(Office 自动化、企业系统、IoT),但 Cua 是第一个 + 最完整 + 最工程化的代表。
如果你是 AI 重度用户 / 企业 IT / Computer-Use 研究者,评估 Cua。 如果你只用 headless browser 自动化,playwright-mcp /browser-use 可能够用。 如果你需要”AI 操作 native app + 跨 OS + sandbox”,没有比 Cua 更完整的开源选项。
我装上跑了两周。 Cua 解决了”agent 操作真实世界” 的多个具体问题。 这件事值得专门写一篇文章。
十八点五、给” 装 Cua 的人” 几条最终 tips
写到最后给” 决定装 Cua” 的人几条具体 tips。
Tip 1:装 Driver 之前先确认 macOS 权限。 macOS 上 Driver 需要 Accessibility 权限。 在 System Settings → Privacy & Security → Accessibility 里预先允许 Cua。 装完 Driver 重启电脑(不是 log out)。
Tip 2:先试 Calculator first task。 Calculator 是最简单 GUI 任务 —— 窗口小、操作少、能 verify 结果。 跑通 Calculator 再试复杂任务。
Tip 3:CUA-S1 第一版只专攻表单。 如果你的任务是” 填 100 行 web form”,CUA-S1 直接能跑。 复杂任务(自由推理 GUI)不要用 CUA-S1,用通用 LLM。
Tip 4:Fleet 跑完任务立即 cleanup。 README 提醒”follow cleanup steps”。 Fleet 保留 paid capacity after claim ends—— 不清 = 持续计费。
Tip 5:Lume 装 macOS Tahoe(不是 Sequoia 或 Sonoma)。 Apple Virtualization.Framework 对最新版 macOS 优化。 老版本 macOS 也能跑但性能差。
Tip 6:Cua Bench 是评测不是跑。 Bench 是评测不是 agent runner。 跑生产任务用 Driver / Fleet,不用 Bench。
Tip 7:跨 OS 调试。 macOS / Windows / Linux 上 accessibility tree 格式不同。 跨 OS agent 代码要测试每个平台。
Tip 8:看 Discord + GitHub Issues。 Cua 团队 Discord 活跃,issues 响应快。 踩坑前先看 issues / Discord 搜索。
这 8 条 tips 不在 README。 跑两周整理出来。
十九、几条关于 Cua Fleets 商业化的补充
Cua Fleets 是整个栈里唯一商业化的部分。 跑两周我看了一些具体场景的 pricing 暗示 + Discord 讨论 + SaaS 行业惯例,整理几条推测(不是官方定价,README 没明说)。
Fleets 计费模式猜测:
- 按 desktop-hour(小时计费):跑一个 Linux desktop 1 小时 $0.05-$0.20。 这条对应”agent 短任务 + 偶尔跑”。
- 按 desktop-month(月计费):保留 desktop 一个月 $20-$50。 这条对应”agent 24/7 跑”。
- 按 team-seat:5 人团队 $50-$100 / 月。 这条对应” 小团队 + 多人用”。
具体数字不在 README。 看 run.cua.ai 注册后 dashboard 给具体报价。
对比:
- AWS EC2 + Linux desktop(自建):~$0.04/hour(t3.small)+ 自己维护。 比 Cua Fleets 略便宜但运维重。
- GitHub Codespaces:~$0.18/hour(2 core 4GB)。 等价于 Cua Fleets 的中等配置。
- Modal / Replicate:~$0.000025/second(CPU)+ GPU 另算。 比 Cua Fleets 便宜但只支持代码,不支持 GUI。
Cua Fleets 贵在 GUI 能力 + sandbox 完整性。 如果只要 Linux container 跑代码,自建 EC2 更便宜。 如果要 GUI + sandbox + 完整跨 OS,Cua Fleets 是合理价格。
enterprise 部署猜测:
- 自托管 Lume VM 集群(用户管)→ 不要钱
- Cua Driver 商业 license(用户跑 open source 仍要 license)→ 价格未知
- Cua Fleets enterprise SLA → 价格未知
Cua 没明说 enterprise pricing。 我估计 enterprise 走” 自托管 Lume + Driver + CUA-S1(open source)+ 商业支持 + SLA” 组合,不走 SaaS Fleets。
二十、对比之前发过的 agent 类项目 + 跨工具协作
写到这里给一条完整的工作流示例 —— 之前发过的所有项目 + 今天 Cua 一起用。
场景:我今天早上要做的事
- 看 GitHub PR review(之前发过的 BrowserSkill 借 Chrome tab)
- 跑个 React 项目的 e2e test(Cua Bench + CUA-S1)
- 改一个 Python 脚本(Claude Code + opencode + context-mode + ponytail)
- 写月度复盘(OpenWhispr 语音 + llm_wiki 沉淀)
- 跟团队同步进度(Tencent/teamai-cli)
完整工作流:
1 | GitHub PR review |
这条完整工作流用了 8 个项目(之前发过的 7 个 + 今天的 Cua)。 每天 1-2 小时。
之前 AI agent 单点工具不够。 这套完整栈够。 每件单独看不够,协作看够。
我之前发过的项目里没有 Cua。 今天补上。 完整栈从 8 件套变成 9 件套。
二十一、给”AI 时代个人工作流” 的几条个人反思
写到最后做个个人反思。
2024 年我开始用 AI agent。 那时候 Claude Code 是唯一主流 agent。 一年过去了,变化巨大:
2024 H1:只有 Claude Code。 一个 agent 干所有事。
2024 H2:出现 Codex、opencode、Cursor。 agent 工具多了,不再只有一个选项。
2025 H1:出现 ponytail、ECC、context-mode。 agent 行为 /context 优化层成熟。
2025 H2:出现 teamai-cli、llm_wiki。 团队 + 个人知识开始有专门工具。
2026 H1:出现 HyperFrames、OpenWhispr、gods-eye-view、MathModelAgent。 AI agent 不再只是写代码,开始做视频、做语音、做 3D、做数学建模。
2026 H2:出现 PI-Desktop(本地优先)、BrowserSkill(借真实浏览器)、Cua(操作真实 GUI)。 AI agent 开始操作真实世界。
这条演化路径清晰:
- 2024:AI agent = 写代码(单点工具)
- 2025:AI agent = 写代码 + 协调 + 沉淀(多工具协作)
- 2026 H2:AI agent = 写代码 + 协调 + 沉淀 + 操作真实世界(完整栈)
AI agent 从单点工具变完整生态。
之前发过的所有项目都在这条演化上。 今天发的 Cua 是最近一步。
未来:
- 2026 H2 - 2027 H1:AI agent 操作更多真实世界场景(Office / IoT / 嵌入式)
- 2027 H1 - 2027 H2:AI agent 自己编排工具(agent 调用 agent)
- 2027 H2 - 2028:AI agent 自学习(从自己的轨迹学)
这条演化会继续。 我会继续发 trending 上的关键项目。
项目地址:https://github.com/trycua/cua
二十二、最后
Cua 是 2026 年下半年 AI agent 操作真实世界这条赛道的早期 + 完整栈。 之前发过的 BrowserSkill 填了” 借真实浏览器”,Cua 填了” 跨 OS native + sandbox + 专用模型”。 两条路径互补,不替代。
如果你:
- 日常用 AI agent 跑 native app → 装 Cua
- 想让 agent 跑 e2e test → 装 Cua Bench
- 想做 Computer-Use 研究 → 读 CUA-S1 + Bench
- macOS 用户想做 macOS automation → 装 Lume
- 想让 agent 操作企业内部系统 → 评估 Cua Fleets
Cua 都适用。
之前发过的所有项目没有 Cua。 装上 Cua,AI agent 操作真实世界这条最后一条边补上。