OSReward 是一个用于评估视觉语言模型(VLM)作为计算机操作智能体(CUA)轨迹评判者的高质量基准,并衍生出聚焦困难案例的 OSReward-Hard 与细粒度评分的 OSReward-Multi。
模型
·HuggingFace Daily Papers(社区热门论文)
OSReward:为跨平台计算机操作智能体奖励模型建立标准化评测
— OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models