Article

Cua一口气开源两款S1模型,还拉Jev来同场考试

动察 Beating AI 快讯,开源 computer-use 基础设施项目 Cua 开源了两款专门做 Computer Use 决策的 S1 模型,同时发布 Cua-Bench-S1,把 Jev 这类模型单独拉出来评测。

这套评测不让模型自己规划。每道题直接给当前界面和一组选好的操作,比如「填邮箱」「勾选同意」「点击提交」「跳过」,模型只选一次。不能反复看屏幕,也没有失败重试。这样测的就是最纯粹的一个问题:下一步该做什么。

一起开源的两款模型走了两条路。Nano 只有约 85.5 万可训练参数,从零训练,专门做候选操作打分;4B 版则直接拿 Qwen3.5-4B 做底座,再微调成同样的「选择题模型」。前者追求极小和极快,后者用大模型原本的理解能力换更强的泛化。

评测除了填表、登录、搜索这些常见操作,还加入安全判断、国际象棋、Doom 和 JevBench。后面几项故意不给模型训练,用来看它离开熟悉任务后还能不能做对决定。

Source: https://m.theblockbeats.info/flash/368639