ProjectsNewsTranslation pending
Cua称开源两款S1 Computer Use决策模型及Cua-Bench-S1
BIBIBI AT A GLANCECua开源两款用于Computer Use决策的S1模型,并发布Cua-Bench-S1评测。
Article
Cua一口气开源两款S1模型,还拉Jev来同场考试
动察 Beating AI 快讯,开源 computer-use 基础设施项目 Cua 开源了两款专门做 Computer Use 决策的 S1 模型,同时发布 Cua-Bench-S1,把 Jev 这类模型单独拉出来评测。
这套评测不让模型自己规划。每道题直接给当前界面和一组选好的操作,比如「填邮箱」「勾选同意」「点击提交」「跳过」,模型只选一次。不能反复看屏幕,也没有失败重试。这样测的就是最纯粹的一个问题:下一步该做什么。
一起开源的两款模型走了两条路。Nano 只有约 85.5 万可训练参数,从零训练,专门做候选操作打分;4B 版则直接拿 Qwen3.5-4B 做底座,再微调成同样的「选择题模型」。前者追求极小和极快,后者用大模型原本的理解能力换更强的泛化。
评测除了填表、登录、搜索这些常见操作,还加入安全判断、国际象棋、Doom 和 JevBench。后面几项故意不给模型训练,用来看它离开熟悉任务后还能不能做对决定。
Source: https://m.theblockbeats.info/flash/368639
AI-assisted interpretation
The following is analysis, separate from reported facts. Verify important claims independently.
每道题会给模型当前界面和一组选好的操作,模型只能选择一次下一步操作,不能反复看屏幕或失败重试。
Why it matters to readers
这种设计专门观察模型在单步Computer Use决策上的能力,以及离开熟悉训练任务后能否做对选择。
它把复杂的电脑操作拆成“下一步选哪个动作”的选择题,便于理解和比较不同模型的决策能力。
Risks and unknowns
- 原文未说明两款模型的具体评测分数。
- 原文未明确说明JevBench的完整含义或Jev模型的具体身份。
- 原文未提供模型代码、权重或许可信息的细节。