
字节Seed开源多模态智能体UI-TARS-1.5

凤凰网科技讯 (作者/杨睿琪)4月18日,字节跳动旗下Seed团队昨日正式开源多模态智能体UI-TARS-1.5。该模型基于视觉-语言框架构建,旨在通过虚拟环境中的任务执行提升基础模型的通用推理能力,支持精准操作电脑、手机系统及浏览器交互等复杂任务。
据介绍,目前,UI-TARS-1.5已在7个典型的GUI图形用户界面评测基准中取得SOTA表现,并首次展现了其在游戏中的长时推理能力和在开放空间中的交互能力。
UI-TARS-1.5在上一代原生GUI智能体基础上,引入强化学习机制优化高阶推理能力,新增“行动前思考”功能,可规划多步骤任务决策。技术层面,团队通过四大维度实现能力升级:增强视觉感知,利用大规模界面截图数据理解元素语义;构建跨平台标准动作空间,提升执行精度;采用System 2推理机制生成任务思维链;建立自动化交互轨迹采集与反思训练范式,使模型持续优化。