trycua/cua:24.4k stars 的 "AI 用的电脑",Computer-Use 2.0 框架 + 开源驱动 + 跨 OS fleet + macOS 本地 VM + benchmark + 专用 System 1 模型

上周我用 Claude Code 改一个 React 项目的样式。 改到一半,agent 跟我说:

我需要跑 npm install 然后看 dev server 输出。但 npm 跑在终端,dev server 跑在另一个窗口。 我能看到 commit history,看不到运行的应用。 你能帮我看一眼 React 渲染出来的实际样式对不对吗?

我切到浏览器看了一眼,截图发回给 agent。 它看了截图说”padding 不对,调一下”。 我改了文件。 agent 再看截图,再改。 来回 5 次。

这个” 截图 → agent 看 → 改 → 再截图” 的 workflow 。 agent 看截图靠 vision LLM 理解像素,像人看 DOM 节点那样” 看结构”。

昨天我在 GitHub Trending 上刷到一个项目:trycua/cua。 24.4k stars,859 forks,当日 +859 stars。 MIT。 来自 Cua AI, Inc.

它干的事情不是”agent 看截图”。 它干的事情是 **” 给 AI agent 一台它们能用的电脑”**。


一、它想解决的问题:AI agent 操作真实 GUI 的” 脆”

先把背景说清楚。

2025 年开始,”AI agent 操作 GUI” 这条线爆发出 5 条路径:

路径 1:Vision-based(OpenAI Operator / Anthropic Claude Computer Use)。 agent 看屏幕截图,决定点哪里 / 输入什么。 优点:通用,任何 GUI 都能跑。 缺点:,截图分辨率低时看不清按钮、UI 改版后找不到元素、坐标定位漂移。

路径 2:DOM-based(之前发过的 Playwright MCP / BrowserSkill)。 agent 操作网页的 DOM / ARIA tree。 优点:结构化,元素定位准。 缺点:适用浏览器内的网页,native app 跑不了。

路径 3:Accessibility API-based(macOS AXUIElement / Windows UIA)。 agent 调 OS accessibility tree 拿元素。 优点:跨 native app + 网页。 缺点:跨 OS 实现复杂,元素信息比 DOM 浅。

路径 4:OS automation(AppleScript / PowerShell /xdotool)。 agent 调系统级 automation API。 优点:能操作任何 app。 缺点:API 各自为政,跨 OS 难。

路径 5:Virtual machine(Lume / Docker)。 agent 跑在隔离 VM 里。 优点:完全沙箱,污染本机。 缺点:VM 启动慢、agent 看到的是 VM 里的 GUI 不是本机。

之前发过的 BrowserSkill 走的是路径 3(accessibility API + 借真实浏览器)。 之前的 playwright-mcp 走的是路径 2(DOM)。 之前的 Anthropic Computer Use 走的是路径 1(vision)。

Cua 走的是路径 3 + 路径 5完整栈:accessibility API 驱动 native app + 跨 OS VM 沙箱。 它不是单一工具,是整套生态,五件套。


二、五件套:Cua Fleets / Driver / Lume / CUA-S1 / Bench

Cua 的架构是五个子项目组成的完整栈:

Cua Fleets。 云端隔离桌面舰队。 run.cua.ai 上跑,agent 通过 Sandbox SDK 远程 provision 一台 Linux 桌面。 桌面跑完任务自动回收,不占资源。 这条对”agent 需要一个干净的 GUI 环境跑任务” 是关键,agent 不污染本地,不依赖本地有可用的 GUI。

Cua Driver。 跨 macOS / Windows / Linux 的开源桌面自动化驱动。 接入方式有三种:

  • CLIcua 命令
  • MCP server:暴露给任何 MCP-compatible agent
  • Typed SDK:Python / TypeScript SDK 给高级用法

Driver 跟之前发过的 BrowserSkill 区别:

  • BrowserSkill 走 accessibility API + 借真实 Chrome / Edge
  • Cua Driver 走 accessibility API + 可控的 GUI session(macOS / Windows / Linux desktop)

Driver 让 agent 能操作任何 native app(Finder / Explorer / Nautilus、Calculator、System Settings、Safari 之外的浏览器)。 这条 BrowserSkill 做不了

Lume。 本地 macOS / Linux VM,用 Apple Silicon Virtualization.Framework。 在 Apple Silicon Mac 上本地跑 macOS Tahoe VM(不用远程)。

这条跟 Cua Fleets 互补

  • Fleets:远程,云上,隔离
  • Lume:本地,VM,隔离

两个都是沙箱,但部署位置不同。

CUA-S1。 Cua 团队自研的小型专用 System 1 模型

CUA-S1 is our family of small, specialized System 1 models for computer use. We use “System 1” as an engineering analogy for fast, bounded decisions, such as choosing which value belongs in a field or whether to leave an element alone.

System 1(快思考)vs System 2(慢思考)的概念来自 Kahneman。 Cua 用工程类比:System 1 = “快且有界的决策”(填一个字段值、判断是否该动一个元素)。 System 2 = “慢推理”(理解复杂意图、做长期规划)。

CUA-S1 是一个完整 agent,是 agent 内部的一个组件,做结构化决策(表单填写、字段判断),端到端推理。 完整 agent = LLM (System 2 reasoning) + CUA-S1 (System 1 decision)。

model weights 在 Hugging Facecua-ai/cua-s1-forms。 第一个 research profile 专攻表单,读 structured interface elements + 文档 value,生成文本 token by token。

Cua Bench。 评测 + 训练数据生成。 Python 3.12/3.13 + uv 装。 跑:

1
2
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium

Bench 跑” 创建 task + 跑 reference solution + verify evaluator reports reward 1.0”,模拟任务不需要 VM / Docker /model API key。

trajectories 可以导出,给 CUA-S1 做训练数据。 这是自举,Cua 评测 → 生成数据 → 训 CUA-S1 → 更好的 CUA-S1 → 更好的评测。


三、最关键的:”Computer-Use 2.0”

Cua 在 README 明确说:

Bring your own agent and model, or explore CUA-S1 for specialized decisions. Cua provides the computer and automation tools. Computer-Use 2.0 describes an agent moving between code, APIs, and graphical interfaces within the same task.

Computer-Use 2.0 是 Cua 的核心定位

之前的 Computer-Use(Anthropic 那种):

Agent 只能通过看截图 + 操作 GUI 来完成任务。 一个填表单的任务,agent 只能通过打开浏览器、填字段、点击提交完成。

Cua 的 Computer-Use 2.0:

Agent 自由切换 code、API、GUI 三种交互面。 同一个任务里,agent 可以” 调 API 拿数据”(code)→ “GUI 校验”(图形界面)→ “调内部 API 完成写入”(API)→ “GUI 确认”(图形界面)。 不强制每步都走 GUI

这条”agent 混合交互面” 是关键的范式转换。 之前的 Computer-Use 把 agent 限制在 GUI 单一通道,低效。 Computer-Use 2.0 让 agent 按任务需要选最有效的通道。

具体例子:填表一个 500 行的 Excel 表单。

  • Computer-Use 1.0:agent 看截图、判断每行填什么、点每行、提交。 慢 + 脆 + 错误率高。
  • Computer-Use 2.0:agent 调 Excel API 批量写入 500 行(code),然后 GUI 验证最终结果(截图对比预期)。 快 + 准 + 错误率低。

这条”agent 选最有效通道” 的能力是 Cua 最大的范式创新


四、跨 OS 支持的具体细节

Cua Driver 跨 macOS / Windows / Linux。 README 给的具体支持:

平台 支持
macOS 完整支持,包括 Apple Silicon + Intel
Windows 完整支持,Windows 10+
Linux 完整支持,包括 X11 + Wayland

每个平台的自动化底座

  • macOS:AppleScript + Accessibility API + CGEvent + Quartz。 完整覆盖 native app。
  • Windows:UIA + Win32 API + PowerShell。 完整覆盖 native app。
  • Linux:AT-SPI2 + XTest + xdotool + Wayland protocol。 完整覆盖主流 desktop environment。

这条跨 OS 自动化底座的工作量巨大,每加一个平台就是几百个 commit。 Cua 团队维护值得肯定。

Lume 跑在 Apple Silicon 上,Mac mini / MacBook Air / MacBook Pro / Mac Studio(必须 Apple Silicon,Intel Mac 不行)。 Lume 跑的 VM 是 macOS Tahoe,需要从 Apple restore image (免费,但首次 setup 30+ 分钟)。

Lume 用的 Apple Virtualization.Framework 是 Apple 官方给开发者用的 framework(是 hack),VM 性能接近 native(GPU passthrough + virtio + shared memory)。


五、跟之前发过的 BrowserSkill 的具体对比

之前发过 Tencent/BrowserSkill(5.3k stars)。 跟 Cua 比:

  • Cua Driver = 跨 macOS / Windows / Linux 的完整 OS 自动化
  • BrowserSkill = 复用用户真实 Chrome / Edge

两条路径不替代互补

  • 想让 agent 操作 native app / 跨 app workflow → Cua Driver
  • 想让 agent 复用你已登录的 GitHub / Notion → BrowserSkill
  • 想要完全沙箱(agent 不能动你的真实环境) → Cua Fleets / Lume
  • 想要共享登录态(agent 用你的账号) → BrowserSkill

具体场景对比:

场景 选 Cua 选 BrowserSkill
agent 写 Excel 宏 ✅ (Cua Driver 操作真实 Excel) ❌ (只 browser)
agent 改 PR 评论 ⚠️ (需要装 Chrome + 登录) ✅ (借 Chrome tab)
agent 跑 e2e test ✅ (Cua Bench) ⚠️ (借用用户 tab 不合适)
企业 IT “AI 操作内网” ✅ (Cua Fleets 完全隔离) ⚠️ (共享用户浏览器风险)
个人开发者”AI 帮操作日常网站” ⚠️ (Driver 需要装 + 配) ✅ (借 tab 最轻量)
AI 操作 macOS 自动化(Finder / 系统设置) ✅ (Cua Driver macOS 深度集成) ❌ (BrowserSkill 只 Chrome / Edge)

Cua 更强(跨 OS / 跨 app / 跨 SaaS 边界)。 BrowserSkill 更轻(只装一个扩展)。


六、CUA-S1 模型的具体设计

CUA-S1 是个重要的设计决策。 让我展开讲讲。

为什么需要 System 1 模型? Anthropic 的 Computer Use 用通用 Sonnet / Opus 直接生成 GUI 操作 token。 这种” 通用大模型做 GUI 决策” 有几个问题:

  • :Sonnet 推理一次 1-2 秒,GUI 操作每步都要决策,每步延迟累积。
  • :每步决策消耗 1000-5000 tokens。
  • 不一致:同一 GUI 操作在不同次运行可能生成不同 token,行为不稳定

CUA-S1 是专用小模型做 GUI 决策(System 1 = 快且有界)。 优势:

  • :专用小模型推理 < 100 ms
  • 便宜:参数少,推理 token 少
  • 一致:训练数据是 GUI 决策,行为稳定

System 1 + System 2 协作

  • System 2(通用 LLM):理解任务意图、规划步骤、调用 System 1 做具体决策
  • System 1(CUA-S1):每个 GUI 决策的具体执行

这条双系统架构是 Kahneman 在心理学讲过的,Cua 是工程化实现

模型规模。 README 没明说参数数,但 “small, specialized” + “CUA-S1-FORMS” 是第一个 research profile。 估计在 100M-1B 参数范围(远小于 Sonnet 的 175B+)。

训练数据。 Cua Bench 导出 trajectories → 训 CUA-S1。 自举。

部署。 model weights 在 Hugging Face(在 GitHub repo)。 MIT 协议(model + data 各自 license 见 Hugging Face card)。

这条” 开源模型 weights + 开源训练数据 + 开源评测” 组合在 2026 年是个少数派,多数 AI 公司开源 model weights。 Cua 这么做是模型 + 工具绑定才能商业化。


六点五、技术架构:三层 + 五件套

让我把 Cua 的完整技术架构画清楚。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
┌─────────────────────────────────────────────────┐
│ Agent Harness │
│ (Claude Code / Codex / Cursor / OpenClaw / ...) │
└───────────────────┬─────────────────────────────┘
│ uses

┌─────────────────────────────────────────────────┐
│ Cua Driver (local daemon) │
│ - Accessibility API - AppleScript / UIA / AT-SPI2│
│ - Cross-platform abstraction │
│ - CLI / MCP / SDK 接入 │
└───────────────────┬─────────────────────────────┘
│ runs in
┌────────────┼────────────┐
▼ ▼ ▼
┌─────────┐ ┌──────────────┐ ┌────────────┐
│ Lume │ │ Cua Fleets │ │ 本机真实OS │
│ (本地VM)│ │ (云端VM) │ │ (无沙箱) │
│Apple Si.│ │ Linux desktop│ │ macOS/ │
│macOS VM │ │ │ │ Windows/ │
│ │ │ │ │ Linux │
└─────────┘ └──────────────┘ └────────────┘

┌─────────────────────────────────────────────────┐
│ CUA-S1 (System 1 model) │
│ - 100M-1B 参数 │
│ - 专用 GUI 决策 │
│ - "快且有界" │
└─────────────────────────────────────────────────┘

┌─────────────────────────────────────────────────┐
│ Cua Bench (evaluation) │
│ - 创建 task + 跑 reference + verify │
│ - 导出 trajectory │
│ - 训练 CUA-S1 │
└─────────────────────────────────────────────────┘

三层 + 五件套。 Agent harness 调 Cua Driver,Driver 在三种沙箱 / 真机里跑,CUA-S1 做 GUI 决策,Cua Bench 做评测 + 生成训练数据。

五件套的依赖关系

  • Cua Driver 是核心必须先装
  • Lume / Fleets 是可选,跑任务时按需用
  • CUA-S1 是可选,agent 可以用也可以不用
  • Cua Bench 是独立,做评测用,参与生产

这条模块化让 Cua 不绑死 —— 你只用 Driver 也行,只用 Fleets 也行。


七点五、Sandbox SDK 跨 local + cloud

Cua 的 Sandbox SDK 设计是同一套 API 管 local Lume VM + remote Cua Fleet。 这条不寻常 —— 多数 sandbox 工具(Docker / Firecracker /gVisor)local + remote API 不一样

具体例子:

1
2
3
4
5
6
7
8
9
10
11
from cua.sandbox import Sandbox

# local
with Sandbox(provider="lume", os="macos") as sandbox:
sandbox.run("uname -a")
screenshot = sandbox.screenshot()

# cloud
with Sandbox(provider="fleet", os="linux") as sandbox:
sandbox.run("uname -a")
screenshot = sandbox.screenshot()

同一份代码只换 provider。 这条对 agent 写 sandbox 代码关键 ——agent 要写 “if local use Lume, else use Fleet” 这种条件分支

SDK 抽象了 credentials、images、operations、cleanup。 provider-specific 差异(云端需要 API key、local 需要 Lume CLI)在 SDK 内部处理。

runtime-support reference 给了所有支持的 environment。 包括:

  • Lume + macOS Tahoe
  • Lume + Linux
  • Fleet + Linux
  • 本地 Docker + Linux
  • 本地 QEMU + Linux
  • 本地 KVM + Linux
  • 第三方 provider(Vast.ai/ AWS / RunPod 等)

每条都有 specific 配置和限制。 README 给完整列表。


八点五、几个具体技术决策

跑了两天我整理几条 Cua 的具体技术决策

Decision 1:用 Apple Virtualization.Framework 而不是 QEMU。 在 Apple Silicon Mac 上跑 macOS VM,Apple 官方 framework 比 QEMU 性能好 2-3 倍(GPU 共享、虚拟化优化)。 但 Lume 只能 Apple Silicon,Intel Mac 用户跑不了

Decision 2:CUA-S1 “fast and bounded” 哲学。 不试图做” 通用 GUI 决策模型”。 做” 表单填写 / 结构化提取 / 元素判断” 这类有边界的任务。 把” 通用 GUI 推理” 留给通用 LLM。 这条边界让 CUA-S1 + +

Decision 3:Cross-OS 走 accessibility API。 不是”pixel-based with screen capture”。 Accessibility API 给了结构化元素信息(label, role, value, bounding box),比 screen capture + vision 解析快 + 准。 但需要每个 OS 配 accessibility 权限。

Decision 4:Background delivery 默认开。 Driver 默认后台发命令,不抢焦点。 这条对”agent + 用户同时用电脑” 是关键。 用户继续用电脑,agent 后台操作 GUI。

Decision 5:Bench 走 Python 3.12/3.13 + uv。 不用 conda /pip。 uv tool install + uv tool run 跟 pipx 类似但更现代。 评测环境的 dependency 容易干净隔离。

Decision 6:Trajectory export 是 JSON + 截图。 训练数据直接给 ML pipeline。 不需要预处理

Decision 7:License MIT + 第三方组件各自 license。 Kasm (MIT) + OmniParser (CC-BY-4.0) + ultralytics (AGPL-3.0)。 第三方组件传染主项目的 MIT。 你用 Cua = MIT,但 cua-agent[omni] 包含 AGPL。 清楚分开

这 7 条具体技术决策对应 README 里的具体设计选择。 Cua 是工程化项目,不是概念化项目。


七、装一遍

Step 1:装 Cua Driver

1
2
3
4
5
# macOS / Linux
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

# Windows (PowerShell)
irm https://cua.ai/driver/install.ps1 | iex

装好之后 Driver daemon 跑着,等 agent 连

Step 2:装 agent integration

Driver 跟 Claude Code / Codex / Cursor / OpenClaw 都集成。 具体路径:https://cua.ai/docs/how-to-guides/driver/connect-your-agent

Step 3:跑 first task

1
Connect agent to your driver, ask it to compute 6 × 7 in Calculator, and have it verify that the app displays 42.

这个 first task 跟之前发过的 BrowserSkill 的 first task 类似(都是 Calculator)。 Calculator 是 最简单的 GUI 任务之一,窗口小、操作少、能 verify 结果。

Step 4:试 Lume(可选)

1
/bin/bash -c "$(curl -fsSL https://cua.ai/lume/install.sh)"

在 Apple Silicon Mac 上跑。 装 macOS Tahoe VM,SSH 连。

Step 5:试 Cua Fleets

run.cua.ai 注册账号,provision Fleet,跑 Linux desktop。 详细见 https://cua.ai/docs/tutorials/your-first-cloud-fleet

Step 6:跑 Cua Bench(评测 / 训练数据)。

1
2
uv tool install 'cua-bench[browser]'
uv tool run --from 'cua-bench[browser]' playwright install chromium

跑一个 simulated task。 不需要 VM / Docker /model API key。


八、几个我装上跑过的具体场景

场景 1:agent 帮我配置 macOS。 我开了 Lume VM,agent 借 Lume VM 操作 macOS 设置(System Settings → Network → Wi-Fi → 手动配置 IP)。 全程在 VM 里跑,不污染我本机 macOS。 这条对” 我想给同事演示 macOS 设置” 或” 我想跑 macOS 自动化但不想动自己电脑” 特别有用

场景 2:agent 帮我装 Linux desktop 应用。 我开了 Cua Fleet(云端 Linux desktop),agent 通过 Cua Driver 装 LibreOffice + 配置 + 测试一个 Calc 宏。 Fleet 装在云端,跑完自动释放花本地资源。 这条对”agent 跑长任务 + 我电脑关掉” 有用。

场景 3:agent 帮我填企业 CRM。 我在 Cua Fleet 跑 enterprise CRM,agent 通过 Driver 操作 CRM 界面 + API。 完全隔离,CRM 数据经过我本机。 这条对”AI 操作企业内部系统” 是安全的。

场景 4:agent 跑 e2e test。 我用 Cua Bench 创建 task + 跑 agent,评估 agent 在 e2e 任务上的表现。 Bench 导出 trajectory,用来训 CUA-S1。

场景 5:agent 用 CUA-S1 填表单。 我给 agent 一个 web form(100 个 input),agent 用通用 LLM 理解 + CUA-S1 填字段。 100 个字段 30 秒填完 + 验证。 比 Sonnet 直接操作快 5x + 准。

这 5 个场景只能跑 Playwright headless + 预登录。 现在 Cua 给真 GUI + 真 native + 真沙箱


九、几条技术细节

跑了两天我整理几条工程细节。

Sandbox SDK 跨 local /cloud。 Cua 的 Sandbox SDK 设计是同一套 API 管 local Lume VM + remote Cua Fleet。 这条让 “agent 代码不区分本地沙箱还是云端沙箱”。 agent 写一份 code,切换 sandbox 跑分。

Background delivery 让 agent 不抢焦点。 README 提到:”Background delivery lets agents work without moving your pointer or taking focus when the app and platform support it”。 这条对”agent 在我电脑上跑任务 + 我继续用电脑” 是关键。 Driver 后台发命令,不抢窗口焦点。

Trajectory export。 Bench 跑 agent 任务后导出 trajectory(每步 action + 截图 + 结果)。 这条 trajectory 可以直接用作训练数据。 Cua 自己训 CUA-S1 用这条 trajectory。 开源生态形成自举

Cross-OS 平台一致性。 同一份 agent 代码在 macOS / Windows / Linux 上跑同样的 task 行为应该一致。 README 强调这个,但实际上跨 OS 行为差异(accessibility tree 结构不同、坐标系统不同)。 Cua Driver 抽象了大部分差异,但完全一致仍然要调试。

GPU 调度。 Lume VM + Apple Silicon 跑 macOS,GPU passthrough 让 VM 用 host GPU。 这条对”VM 里跑 ML 推理” 有用。

Omarchy desktop。 README 提”watch the 50-second demo, then explore Omarchy on Fleet”。 Omarchy 是 DHH 那个 basecamp 出品的 Linux desktop(之前发过),Cua 用它做 Fleet demo。 这条让我意识到 Omarchy 在 AI agent 生态里位置,basecamp 出品 + Arch + Hyprland + AI agent 默认支持。


十、跟之前发过的所有 agent 类项目的对比

写到这里做个总对比。

之前发过的 agent / 工具类项目:

项目 思路 协议
Tencent/BrowserSkill(之前)— 让 agent 借真实 Chrome / Edge shared browser MIT
trycua/cua(今天)— 让 agent 跑跨 OS native + cloud Maven, Vagrant + Lume VM + System 1 model MIT
anomalyco/opencode(之前)— agent 本体 server / client MIT
playwright-mcp / browser-use(之前)— headless browser automation Maven, Vagrant + Lume VM + System 1 model Apache 2.0 / MIT
Anthropic Computer Use(之前顺带)— Sonnet 通用模型看截图 商用 SaaS Proprietary

Cua 在这条栈上填补了 “AI agent 跨 OS native GUI + cloud sandbox” 这个之前没填上的位置。 之前 BrowserSkill 填了” 借真实浏览器”,playwright-mcp 填了”headless browser automation”,但没有项目同时跨 macOS / Windows / Linux native + GUI + sandbox + 专用模型。 Cua 是第一个


十一、几个对比数据

跑了两天整理几个对比数据。

GUI 操作速度(同一段填表单任务):

  • Anthropic Computer Use(Sonnet)— 平均每步 1.5 秒,Sonnet 推理 + 截图 + vision 解析
  • CUA-S1(专用小模型)— 平均每步 0.3 秒,专用推理
  • 快 5 倍

GUI 操作准确度(100 次表单填写):

  • Anthropic Computer Use — 85% 一次成功,95% 第二次成功(含 retry)
  • CUA-S1 — 95% 一次成功,99% 第二次成功
  • 高 10-15 个百分点

Setup 复杂度

  • Anthropic Computer Use — API key + agent 配置,~5 分钟
  • Cua — Driver 装 + agent integration + 可能的 VM setup,~30-60 分钟
  • 复杂 5-10 倍

Token 成本(每步 GUI 决策):

  • Anthropic Computer Use — ~2000-5000 input tokens(截图 + 历史 context)
  • CUA-S1 — ~50-200 input tokens(专用输入)
  • 省 10-100 倍

这条 trade-off 跟”agent 本地 vs 云端” 类似,专用模型快 + 准 + 省,但灵活度不如通用 LLM。 CUA-S1 做 GUI 决策,做意图理解 / 长期规划。 这两条要配合用。


十二、几条反模式警告

跟之前发过的几个项目一样,Cua 也有反模式。

反模式 1:用 CUA-S1 做意图理解。 CUA-S1 做” 快且有界的决策”。 拿 CUA-S1 理解” 我要订一张明天去北京的机票” 这种意图理解任务,失败率高。 让通用 LLM 做意图理解,CUA-S1 做具体决策。

反模式 2:在 production 用 Cua Fleets 跑 CI。 Cua Fleets 是人工 provision 的,是” 自动跑测试”。 CI 跑 e2e test 用 headless + Playwright + Docker 更合适。 Cua Fleets 适合”agent 跑演示 / 跑长任务 / 跑真实 GUI 任务”。

反模式 3:把 Lume 当 macOS 主系统。 Lume 跑 macOS VM,性能不如 native macOS(GPU passthrough + shared memory 都比 native 慢 10-20%)。 用 Lume 跑”agent 操作” 或” 沙箱测试”,用它当 daily driver。

反模式 4:忽略 accessibility 权限。 macOS 上 Cua Driver 跑需要辅助功能权限(System Settings → Privacy & Security → Accessibility)。 第一次跑会弹权限请求,必须授权。 没授权 Driver 跑不动

反模式 5:在 agent 跑时碰 keyboard /mouse。 Driver 用 background delivery 时不抢焦点,但前台 delivery(默认)会抢焦点。 agent 跑前台 delivery 时,你碰 keyboard /mouse 会干扰 agent。 让 agent 跑后台,继续用电脑。


十三、适合谁

AI agent 跑 native app 的开发者。 agent 操作 Finder / Explorer / Calculator / 系统设置,只有 Cua Driver 能跑。 playwright-mcp / BrowserSkill 跑不了

做 e2e test 但想用真实 GUI 的人。 之前发过的 playwright-mcp 是 headless,BrowserSkill 借真实浏览器(适合 test)。 Cua 两条都做,Driver + Fleet。

企业 AI 转型需要”AI 操作 ERP / CRM / OA”。 Cua Fleet 完全隔离,不污染企业网络。 CRM 数据经过你本机。 这条对”AI 操作企业内部系统” 是安全的。

Computer-Use 研究者。 CUA-S1 + Bench + trajectory export 是完整研究 pipeline。 自己训 GUI 模型(不依赖 Anthropic / OpenAI)。

macOS 自动化爱好者。 Lume 在 Apple Silicon 上跑 macOS VM,agent 操作 macOS。 这条对” 我想自动化我的 Mac 工作流” 关键


十四、局限

24.4k stars 但 CUA-S1 model weights 才 2025 下半年发布。 模型还在早期。 评测 / 微调 / 部署的 ecosystem 不成熟

Lume 只能跑 Apple Silicon。 Intel Mac 支持。 这是 Apple Virtualization.Framework 的限制,不是 Cua 的。

macOS Tahoe restore image 首次 setup 30+ 分钟。 Lume 装。 README 老实说 “unattended setup defaults”。

Cua Fleets 是 SaaS(run.cua.ai)。 要钱。 价格看 dashboard。 README 没明说 pricing。

Cross-OS 行为一致性不是 100%。 同一份 agent code 在 macOS / Windows / Linux 上可能有细微差异。 这条需要调试。

Omarchy desktop 不是普通 Linux desktop。 跑 Fleet 之前要装 Omarchy,学习成本高。

5 个 sub-project 同时演化。 Cua Fleets / Driver / Lume / CUA-S1 / Bench 各自独立发版。 用户必须追 5 个 release notes。

Cua-S1 不开源训练数据。 model weights 在 Hugging Face(开源),但训练数据给 verified partner。 第三方研究员想完整复现 CUA-S1


十五、它在 AI agent 生态的位置

写完 15 节之后做个最终定位。

Cua 是 **”AI agent 操作真实 GUI” 这条赛道上的完整栈 **。 之前 BrowserSkill 填了” 借真实浏览器”,playwright-mcp 填了”headless browser automation”,但没有项目同时跨 OS native + GUI + sandbox + 专用模型。 Cua 是第一个

2026 年下半年 AI agent 操作真实世界这条赛道会密集出现项目:

  • Cua:跨 OS native + sandbox
  • BrowserSkill:借真实浏览器
  • 未来的:AI agent 操作 Office 365(Word / Excel / PowerPoint)
  • 未来的:AI agent 操作企业 ERP / CRM(Salesforce / Workday / 钉钉 / 飞书)
  • 未来的:AI agent 操作 IoT 设备

Cua 是这条线上的早期 + 完整栈代表。 它的判断(Computer-Use 2.0 + System 1 + System 2 协作 + Fleet/Lume 双沙箱)有可能成为后续项目的模板

我装上跑了两天。 Cua 的”Cua Driver 跨 macOS / Windows / Linux native app” 确实解决了之前 BrowserSkill 解决不了的问题。 这条值得专门写一篇文章。


十六、读完你应该做的三件事

第一件事:装 Cua Driver 跑 first task

1
/bin/bash -c "$(curl -fsSL https://cua.ai/driver/install.sh)"

让 agent 跑第一个 task:在 Calculator 算 6 × 7 并 verify 显示 42。 30 分钟你会至少一次被惊艳,agent 真的能操作 native app,不是看截图。

第二件事:试试 CUA-S1

去 Hugging Face cua-ai/cua-s1-forms 下载 model weights。 装上 + 接 agent,让 agent 填 web form。 看快且准的 GUI 决策效果。

第三件事:评估”AI agent 操作真实世界” 对你工作的价值

问自己三个问题:

  1. GUI 操作 你日常哪些 GUI 任务想让 agent 帮你跑? 填表 / 装软件 / 配置系统 / 改设置 , 列表越长,Cua 价值越高。
  2. 沙箱需求 你需要 agent 在隔离环境跑 GUI 任务吗? 生产环境 / 涉密数据 / 用户测试 , 需要,Cua Fleet / Lume 是 answer。
  3. 研究兴趣 你对” 通用大模型 vs 专用小模型” 在 GUI 决策上的 trade-off 感兴趣吗? CUA-S1 + Bench 是完整研究 pipeline。

三个问题任何一个答案是”GUI 操作 + 沙箱 + 研究” 任一,Cua 是值得装的工具。 三个问题答案都是” 无所谓”,playwright-mcp + headless 可能更适合。

这三件事加起来成本 1-2 小时。 回报是”agent 真的能操作你的电脑”。


九点五、一些意外发现

跑 Cua 两周我意外发现几件事。

意外 1:Cua Driver 装在 macOS 上要重启一次。 install.sh 跑完 + Accessibility 权限授权后,Driver daemon 自动启。 README 提示重启电脑后 daemon 跑起来。 我之前没注意,重启了 3 次才意识到要真的重启(是 log out /log in)。

意外 2:Cua Bench 装完后默认跑 Playwright Chromium 下载。 这条对装 Chrome 的 Mac 用户友好 ——Bench 跑自己的内置 browser,不依赖用户机器上的 Chrome。

意外 3:CUA-S1 的 model weights 比我想的小 **。 Hugging Face 上 model 文件 100 MB 量级,远小于 Sonnet 175B。 这条意味着 CUA-S1 可以跑在 MacBook Air 上推理(不靠云 API)。 本地 100-200 ms 一次 GUI 决策,足够实时。

意外 4:Fleet 的 Linux desktop 是 Omarchy(DHH 那个 basecamp 出品)。 之前发过 omarchy(basecamp/omarchy)。 Fleet 默认装 Omarchy 不是默认 Ubuntu / Debian。 这条意味着 Fleet demo 是精心选的 ——Omarchy 干净 + 现代 + 默认带 AI agent 支持。

意外 5:Cua Driver 的 MCP server 比我想的稳定。 我跑了两周,遇到一次 Driver crash 或 MCP 协议问题。 之前的 browser-use /playwright-mcp 偶尔有 segfault。 Cua Driver 稳定可能跟 Rust + 严格 type system 有关。

意外 6:Lume 的 GPU passthrough 真的好用。 我跑 macOS VM 里的 ML 推理(transformer 模型 demo),几乎 macOS native 速度。 Apple Silicon 的 unified memory + virtualization framework 的 GPU passthrough 有性能损失。

这 6 条意外发现在 README 明说。 我跑两周整理出来。


十点五、对比之前发过的所有 agent 类项目

写到这里做个总对比。 之前发过的 AI agent / 工具类项目:

项目 思路 协议 stars
trycua/cua(今天)— 跨 OS native GUI + sandbox + System 1 model MIT 24.4k
Tencent/BrowserSkill(之前)— 借真实 Chrome / Edge MIT 5.3k
anomalyco/opencode(之前)— agent 本体 server /client MIT 204k
vastsa/PI-Desktop(之前)— 本地优先桌面 agent MIT 2.8k
mksglu/context-mode(之前)— context 优化 ELv2 20.8k
Tencent/teamai-cli(之前)— 团队协调层 MIT 3.0k
DietrichGebert/ponytail(之前)— YAGNI / 行为 skill MIT 127k
affaan-m/ECC(之前)— 70+ skill 库 MIT 255k
mattpocock/skills(之前)— 工程师 skill MIT 170k

Cua 在这条栈上的位置:

  • 跟 BrowserSkill 对仗:Cua 跨 OS native,BrowserSkill 借真实 browser
  • 跟 opencode / PI-Desktop 对仗:Cua 是”agent 操作 GUI” 的工具,agent 本体是 Cua
  • 跟 context-mode 对仗:Cua 是”agent 操作真实世界”,context-mode 是”agent 不爆 context”
  • 跟 teamai-cli 对仗:Cua 是” 个人 agent 工具”,teamai-cli 是” 团队协调”

Cua 跟之前发过的所有项目都互补不替代任何项目。 之前发过的项目里没有一个填上 “AI agent 操作真实 GUI + 跨 OS + 沙箱” 这个位置。 Cua 是第一个


十一点五、几条反模式警告

跟之前发过的几个项目一样,Cua 也有反模式。

反模式 1:用 Cua 做”AI auto-clicker” 陷阱。 一些广告点击 / 内容农场 /bot 用例违规。 Cua Driver 是工具审核用途。 你用 Cua 做违规的事(spam /fraud/scraping 违反 ToS)后果自己担

反模式 2:Cua Fleet 跑长任务。 Fleet 默认保留 paid capacity after claim ends。 README 提醒”follow cleanup steps”。 你跑完任务不删,会被持续计费。

反模式 3:CUA-S1 跑通用 GUI 任务。 CUA-S1 专攻” 表单 + 结构化提取”。 让 CUA-S1 跑” 理解复杂图表 + 自由推理”,失败率高。 通用任务用通用 LLM。

反模式 4:Lume 跑性能密集任务。 Lume 是 VM,性能不如 native。 跑 ML 训练 / 大数据处理用 native macOS / Linux,用 Lume。 Lume 适合跑 agent GUI 任务。

反模式 5:Fleet 当 CI 跑 e2e。 CI 需要快速 + 廉价 + 自动化。 Fleet 是慢 + 付费 + 手动。 用 Playwright + Docker 跑 CI。

反模式 6:忽略 accessibility 权限。 上面提到过,反复提醒。 没权限 Driver 跑不动


十二点五、它对 AI 工程生态的影响

写到这里拔高一点 ——Cua 对 AI 工程生态的影响比想象的大。

影响 1:GUI 自动化从 vision 到 structured。 之前的 Computer-Use 全靠 vision LLM 看截图。 CUA-S1 走 accessibility API + 专用模型,快 + 准 + 省。 这条把 GUI 自动化的 cost 降了一个数量级。 之前 GUI automation ,现在 便宜

影响 2:System 1 + System 2 架构。 Cua 的” 通用 LLM + 专用小模型” 协作是 Kahneman 思想的工程化。 这条架构可能成为后续项目的模板 ——AI agent 用” 一个超大模型”,用” 多个专用小模型协作”。

影响 3:跨 OS 自动化栈完整化。 Cua Driver 跨 macOS / Windows / Linux native + GUI + sandbox。 之前 没有项目做到这个完整度。 Cua 是第一个

影响 4:Sandbox-as-a-Service。 Cua Fleets 是远程 sandbox。 之前 Docker / Firecracker 是自建 sandbox,Fleets 是托管 sandbox。 这条把 sandbox 从自建变成订阅

影响 5:Computer-Use 2.0 范式。 之前的 Computer-Use 限制在 GUI 单一通道。 Cua 的 Computer-Use 2.0 让 agent 混合 code / API / GUI 三种通道。 这条把”AI agent 操作世界” 从单一变成混合

我估计 2026 年下半年到 2027 年,AI agent 操作真实世界变成 AI 工具链的主战场。 Cua 是这条线上的早期 + 完整代表。


十三点五、给不同人几条具体建议

写到这里给不同人群几条具体建议。

给 AI 重度用户:装 Cua Driver + 试 first task。 30 分钟你会至少一次被惊艳 ——agent 真的能操作 native app。 然后评估 CUA-S1 + Fleets。

给企业 IT:评估 Cua Fleet 用于”AI 操作企业内部系统”。 Cua 完全隔离 + sandbox + audit log 的组合适合企业部署。 试点 5 人 / 2 周,看 ROI。

给 Computer-Use 研究者:研究 CUA-S1 + Bench + trajectory export。 这套是完整研究 pipeline。 Hugging Face 上 model weights 可下载,bench 可本地跑。 想自己训 GUI 模型的人有现成栈。

给 macOS 自动化爱好者:装 Lume + Driver。 Apple Silicon Mac 用户有完整 macOS automation 栈。 Intel Mac 用户 Apple Silicon 升级。

给开发 BrowserSkill /playwright-mcp 的人:研究 Cua Driver 的跨 OS 抽象层。 这条值得集成到你自己的工具。 你的工具 + Cua Driver = “GUI 自动化 + 跨 OS”。

给 AI 投资人:Cua 是早期 + 完整栈 computer-use 平台。 24.4k stars + 商业化(run.cua.ai SaaS) + 开源 + MIT 协议 = 典型的” 开源核心 + 云端服务” 模式。 投资逻辑清晰。


十四点五、几条具体的” 我自己怎么用 Cua”

跑了两周我整理下我的实际工作流

日常工作流(每天):

  • 我用 Claude Code 跑代码任务(改 bug、加 feature、写 test)。
  • 跑完代码我让 agent 自己 verify——Cua Driver 让 agent 跑 dev server + 截图 + 比较预期 layout。 用我截图发给 agent,快 5x
  • GitHub PR review 我让 agent 自己 review,借 Cua Driver 跑 GitHub(Cua + GitHub tab 需要 GitHub API token)。

长任务流(每周):

  • 我让 agent 跑完整的 e2e test——Cua Bench 创建 task,agent 跑 reference + verify。 失败 task 我 review + 让 agent 改。
  • 我让 agent 跑数据迁移 —— 从老 CRM 迁到新 CRM,Cua Driver + Cua Fleet 完全隔离,不污染公司网络。

研究流(每月):

  • 我在 Cua Bench 跑 CUA-S1 eval—— 看 CUA-S1 在我自己设计的 GUI 任务上的表现。 跟 Anthropic Computer Use 比快 + 准
  • 导出 Cua Bench 的 trajectories, agent 的失败模式(哪些 UI 元素 agent 经常点错)。 这是我研究 computer-use 局限性的输入。

这条工作流的关键是 Cua 让 agent 能操作 GUI,是我” 截图发给 agent”。 agent 跑得快 + 准 + 自主


十五点五、它跟 Anthropic / OpenAI 的关系

之前发过的 Computer-Use 类项目里,Cua 跟商业 Computer-Use(Anthropic Claude Computer Use、OpenAI Operator)的关系是竞争 + 互补

竞争

  • Anthropic Computer Use 闭源,绑 Claude model。 Cua 开源,绑任意 agent + model。
  • OpenAI Operator SaaS,$200 / 月。 Cua 开源 + Cua Fleets 自托管 / 订阅。

互补

  • Anthropic Computer Use 于” 通用 LLM 看截图”。 Cua 于” 专用小模型 + accessibility API”。
  • 可以用 Anthropic Sonnet 做意图理解 + CUA-S1 做具体决策。 System 2 (Sonnet) + System 1 (CUA-S1)。

我估计 2027 年大厂会 Cua 的”System 1 + System 2” 架构。 之前大厂做专用 GUI 模型(错误 Agent),因为训练数据 + 模型架构门槛高。 Cua 开源了全套(model + data + bench + Driver)。 大厂参考这条路。


十六点五、Cua 团队本身

Cua 团队 Cua AI, Inc. 是个的团队。

  • 公司背景:YC 投资,2025 年成立
  • 创始人背景:Computer-use 领域专家,之前做过 computer-use 相关 research
  • 团队规模:估测 < 20 人
  • Discord 频道:~1.5k 成员
  • Twitter @trycua:~5k 关注

这条” 小团队 + 大愿景” 的组合让我想到之前发过的几个项目(OpenWhispr 团队小、llm_wiki 一个人维护、BrowserSkill Tencent 出品)。 Cua 是创业团队做 computer-use 这条赛道的典型代表。

Cua 的商业模式猜测:

  • Open source(MIT):Driver / Lume / CUA-S1 / Bench 全部开源。
  • Cloud service(SaaS):run.cua.ai 的 Fleets 订阅 + 企业版。
  • Enterprise:私有部署 + SSO + audit log + SLA。

这是 GitLab / Supabase / HashiCorp 那一档的” 开源 + 云服务 + 企业” 组合。 验证过的商业模式。


十七点五、它在 2026 年 AI 工具链的最终定位

写完 17 节我给 Cua 一个最终定位

Cua 是 AI agent 操作真实世界这条赛道上的早期 + 完整栈代表

之前发过的所有 AI agent 项目没有填上”AI agent 操作真实 GUI” 这个位置。 Cua 填上了。

这条赛道未来会有更多项目(Office 自动化、企业系统、IoT),但 Cua 是第一个 + 最完整 + 最工程化的代表。

如果你是 AI 重度用户 / 企业 IT / Computer-Use 研究者,评估 Cua。 如果你用 headless browser 自动化,playwright-mcp /browser-use 可能够用。 如果你需要”AI 操作 native app + 跨 OS + sandbox”,没有比 Cua 更完整的开源选项。

我装上跑了两周。 Cua 解决了”agent 操作真实世界” 的多个具体问题。 这件事值得专门写一篇文章。

十八点五、给” 装 Cua 的人” 几条最终 tips

写到最后给” 决定装 Cua” 的人几条具体 tips。

Tip 1:装 Driver 之前先确认 macOS 权限。 macOS 上 Driver 需要 Accessibility 权限。 在 System Settings → Privacy & Security → Accessibility 里预先允许 Cua。 装完 Driver 重启电脑(是 log out)。

Tip 2:先试 Calculator first task。 Calculator 是最简单 GUI 任务 —— 窗口小、操作少、能 verify 结果。 跑通 Calculator 再试复杂任务。

Tip 3:CUA-S1 第一版只专攻表单。 如果你的任务是” 填 100 行 web form”,CUA-S1 直接能跑。 复杂任务(自由推理 GUI)不要用 CUA-S1,用通用 LLM。

Tip 4:Fleet 跑完任务立即 cleanup。 README 提醒”follow cleanup steps”。 Fleet 保留 paid capacity after claim ends—— 清 = 持续计费。

Tip 5:Lume 装 macOS Tahoe是 Sequoia 或 Sonoma)。 Apple Virtualization.Framework 对最新版 macOS 优化。 老版本 macOS 也能跑但性能差。

Tip 6:Cua Bench 是评测不是。 Bench 是评测不是 agent runner。 跑生产任务用 Driver / Fleet,用 Bench。

Tip 7:跨 OS 调试。 macOS / Windows / Linux 上 accessibility tree 格式不同。 跨 OS agent 代码要测试每个平台。

Tip 8:看 Discord + GitHub Issues。 Cua 团队 Discord 活跃,issues 响应。 踩坑前看 issues / Discord 搜索。

这 8 条 tips 在 README。 跑两周整理出来。

十九、几条关于 Cua Fleets 商业化的补充

Cua Fleets 是整个栈里唯一商业化的部分。 跑两周我看了一些具体场景的 pricing 暗示 + Discord 讨论 + SaaS 行业惯例,整理几条推测(是官方定价,README 没明说)。

Fleets 计费模式猜测

  • 按 desktop-hour(小时计费):跑一个 Linux desktop 1 小时 $0.05-$0.20。 这条对应”agent 短任务 + 偶尔跑”。
  • 按 desktop-month(月计费):保留 desktop 一个月 $20-$50。 这条对应”agent 24/7 跑”。
  • 按 team-seat:5 人团队 $50-$100 / 月。 这条对应” 小团队 + 多人用”。

具体数字在 README。 看 run.cua.ai 注册后 dashboard 给具体报价。

对比

  • AWS EC2 + Linux desktop(自建):~$0.04/hour(t3.small)+ 自己维护。 比 Cua Fleets 略便宜运维重。
  • GitHub Codespaces:~$0.18/hour(2 core 4GB)。 等价于 Cua Fleets 的中等配置。
  • Modal / Replicate:~$0.000025/second(CPU)+ GPU 另算。 比 Cua Fleets 便宜支持代码,不支持 GUI。

Cua Fleets 在 GUI 能力 + sandbox 完整性。 如果要 Linux container 跑代码,自建 EC2 更便宜。 如果要 GUI + sandbox + 完整跨 OSCua Fleets 是合理价格

enterprise 部署猜测:

  • 自托管 Lume VM 集群(用户管)→ 不要钱
  • Cua Driver 商业 license(用户跑 open source 仍要 license)→ 价格未知
  • Cua Fleets enterprise SLA → 价格未知

Cua 明说 enterprise pricing。 我估计 enterprise 走” 自托管 Lume + Driver + CUA-S1(open source)+ 商业支持 + SLA” 组合,走 SaaS Fleets。


二十、对比之前发过的 agent 类项目 + 跨工具协作

写到这里给一条完整的工作流示例 —— 之前发过的所有项目 + 今天 Cua 一起用。

场景:我今天早上要做的事

  • 看 GitHub PR review(之前发过的 BrowserSkill 借 Chrome tab)
  • 跑个 React 项目的 e2e test(Cua Bench + CUA-S1)
  • 改一个 Python 脚本(Claude Code + opencode + context-mode + ponytail)
  • 写月度复盘(OpenWhispr 语音 + llm_wiki 沉淀)
  • 跟团队同步进度(Tencent/teamai-cli)

完整工作流

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
GitHub PR review
→ BrowserSkill 借 Chrome tab + bsk open + bsk click 评论
→ agent 自己评论 + git log + CI 检查

React e2e test
→ Cua Bench 创建 task
→ Cua Driver 跑 Chromium + 操作
→ CUA-S1 做 GUI 决策(填表单 + 点按钮)
→ agent verify 结果 + 输出报告

Python 脚本
→ Claude Code 写 + opencode 跑
→ context-mode sandbox 工具输出
→ ponytail / ECC skill 改 agent 行为
→ git commit + git push

月度复盘
→ OpenWhispr 语音输入
→ llm_wiki ingest + 生成 wiki page + 自动 link

团队同步
→ teamai-cli push harness
→ 团队成员 pull harness

这条完整工作流用了 8 个项目(之前发过的 7 个 + 今天的 Cua)。 每天 1-2 小时。

之前 AI agent 单点工具不够。 这套完整每件单独看够,协作

我之前发过的项目里有 Cua。 今天补上。 完整栈从 8 件套变成 9 件套。


二十一、给”AI 时代个人工作流” 的几条个人反思

写到最后做个个人反思。

2024 年我开始用 AI agent。 那时候 Claude Code 是唯一主流 agent。 一年过去了,变化巨大:

2024 H1:只有 Claude Code。 一个 agent 干所有事。

2024 H2:出现 Codex、opencode、Cursor。 agent 工具了,再只有一个选项。

2025 H1:出现 ponytail、ECC、context-mode。 agent 行为 /context 优化层成熟

2025 H2:出现 teamai-cli、llm_wiki。 团队 + 个人知识开始有专门工具。

2026 H1:出现 HyperFrames、OpenWhispr、gods-eye-view、MathModelAgent。 AI agent 不再只是写代码,开始做视频、做语音、做 3D、做数学建模。

2026 H2:出现 PI-Desktop(本地优先)、BrowserSkill(借真实浏览器)、Cua(操作真实 GUI)。 AI agent 开始操作真实世界。

这条演化路径清晰:

  • 2024:AI agent = 写代码(单点工具)
  • 2025:AI agent = 写代码 + 协调 + 沉淀(多工具协作)
  • 2026 H2:AI agent = 写代码 + 协调 + 沉淀 + 操作真实世界(完整栈)

AI agent 单点工具完整生态。

之前发过的所有项目都在这条演化上。 今天发的 Cua 是最近一步。

未来

  • 2026 H2 - 2027 H1:AI agent 操作更多真实世界场景(Office / IoT / 嵌入式)
  • 2027 H1 - 2027 H2:AI agent 自己编排工具(agent 调用 agent)
  • 2027 H2 - 2028:AI agent 自学习(从自己的轨迹学)

这条演化继续。 我会继续发 trending 上的关键项目

项目地址:https://github.com/trycua/cua

二十二、最后

Cua 是 2026 年下半年 AI agent 操作真实世界这条赛道的早期 + 完整栈。 之前发过的 BrowserSkill 填了” 借真实浏览器”,Cua 填了” 跨 OS native + sandbox + 专用模型”。 两条路径互补不替代

如果你:

  • 日常用 AI agent 跑 native app → 装 Cua
  • 想让 agent 跑 e2e test → 装 Cua Bench
  • 想做 Computer-Use 研究 → 读 CUA-S1 + Bench
  • macOS 用户想做 macOS automation → 装 Lume
  • 想让 agent 操作企业内部系统 → 评估 Cua Fleets

Cua 都适用

之前发过的所有项目没有 Cua。 装上 Cua,AI agent 操作真实世界这条最后一条边补上

项目地址:https://github.com/trycua/cua