Cua称开源两款S1 Computer Use决策模型及Cua-Bench-S1
Cua称已开源Nano与4B两款用于Computer Use下一步操作选择的S1模型,并发布Cua-Bench-S1评测集。
正在加载…
把分散的消息,连成可以理解的脉络。
Cua称已开源Nano与4B两款用于Computer Use下一步操作选择的S1模型,并发布Cua-Bench-S1评测集。
Artificial Analysis评测称,Claude Opus 5.5 max以58分居首;GPT-6 Sol和Luna性能接近前代,但任务成本明显降低。
意大利AI实验室Paradigma发布并开源数学模型Limite 1B - Violetto,官方评测称其AIME 2026得分94.01%,但横向成绩并非全部统一复测。
报道称xAI已发布Grok 4.7并上线多个平台;其参数、定价及基准成绩等细节目前仅见于所给二手报道。
小米MiMo公开直播的Pro和Flash强化学习训练均停在30个完整步骤,合计花费347.47万美元,评测成绩整体提升但期间出现回落及基础设施故障。