UI-TARS 实战:会自己点屏的 GUI 自动化智能体
发布时间:2026/9/15 16:55:48 作者:尧图编辑部 阅读量:1,286

UI-TARS 实战会自己点屏的 GUI 自动化智能体【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS当你需要让 AI 替你完成第 128 步的浏览器点击时逐条手写脚本和选择器已经撑不住了。UI-TARS 是字节跳动开源的 GUI 自动化智能体它直接读截图就能决定点哪里、输什么输出 Thought–Action 推理链不依赖 DOM 元素树或控件选择器。 先看它能做到什么UI-TARS-1.5 是开源多模态智能体视觉语言模型在虚拟环境里完成桌面、浏览器、手机三类 GUI 任务。官方公布的基准对比基准UI-TARS-1.5OpenAI CUAClaude 3.7此前 SOTAOSWorld100 步42.536.42838.1200 步ScreenSpotPro屏幕坐标定位61.623.427.743.6OSWorld 是真实操作系统任务成功率ScreenSpotPro 考察屏幕上精确找到指定元素的能力。后者比第二名高出约 35 分说明 UI-TARS 的核心长板是看得准。在桌面、浏览器、Android 三端执行 GUI 操作一套动作空间不用为每个平台写适配层用先思考、后行动的推理链复杂任务里更少误点把点击、拖拽、快捷键、滚动统一成结构化动作解析器直接生成 PyAutoGUI 脚本开源 7B 模型加本地解析包可私有化部署与二次开发 跑通从 clone 到第一次推理git clone https://gitcode.com/GitHub_Trending/ui/UI-TARS cd UI-TARS pip install ui-tars # 或 uv pip install ui-tars模型侧用 Hugging Face 推理端点部署 7B 模型建议 L4/A100 级显卡完整配置参数见 README_deploy.md含环境变量与 API 调用示例这里不展开。解析侧的最小示例把模型回复变成 PyAutoGUI 代码——from ui_tars.action_parser import parse_action_to_structure_output, parsing_response_to_pyautogui_code response Thought: Click the button\nAction: click(start_box(100,200)) parsed parse_action_to_structure_output( response, factor1000, origin_resized_height1080, origin_resized_width1920, model_typeqwen25vl) print(parsing_response_to_pyautogui_code(parsed, image_height1080, image_width1920))factor是坐标缩放因子model_type区分 Qwen-VL 与 Seed-VL 两种输出格式其余参数以 codes/README.md 的 API 文档为准。 看懂它如何定位屏幕坐标UI-TARS 的动作空间由感知、动作、推理、经验学习四块能力组成模型与环境的交互闭环见架构图最核心的一条链路是坐标映射走输入→处理→输出三步输入截一张原始分辨率截图比如 1920x1080。处理模型按 Qwen2.5-VL 的smart_resize规则缩放图像规则是两边长取 28 的整数倍、总像素夹在 100×28×28 到 16384×28×28 之间、尽量保持宽高比。输出模型给出基于缩放后尺寸的绝对坐标再按原图与缩放图的宽高比映射回原始屏幕位置才落点。下面这张图演示了这个映射过程红点就是映射后的点击位置第二条链路是思考-行动模型先输出Thought写清小计划并总结下一步要点的元素再输出Action。强化学习让这条推理链可随推理时间扩展官方数据里开启 Thought 后 Minecraft 等长程任务的成功率普遍高于关闭时。 选对桌面、手机还是纯定位三套 prompt 模板都在 codes/ui_tars/prompt.py 里选哪套看两件事跑在什么环境、要不要模型想。场景模板动作空间差异注意Windows/Linux/macOS 桌面COMPUTER_USE单击/双击/右键、拖拽、hotkey、type、滚动快捷键最多 3 个键且用空格分隔写进模板约定里了手机或 Android 模拟器MOBILE_USE增加long_press、open_app、press_home、press_back用open_app启动应用比模拟找图标更稳只评估定位能力GROUNDING只有click不输出 Thought训练与评测专用别拿来跑完整任务判断顺序先定平台再定要不要推理。具体动作字段以 prompt.py 源码为准。⚠️ 避开这些坑能省不少事现象点的位置整体偏移甚至错得离谱。原因UI-TARS-1.5 基于 Qwen2.5-VL输出的是绝对像素坐标即像素在缩放后图像上的实际位置不是 0~1 归一化坐标解析时少传或传错原始分辨率就会算歪。规避解析时一定把原始截图宽高传对批量执行前先用 README_coordinates.md 里的可视化脚本把坐标画回原图确认确认红点落位再跑任务。现象本地部署起不来或大图请求失败。原因7B 多模态模型吃显存多轮对话加截图的上下文还很长。规避官方推荐 L40S/A100/L4 级 GPU走 Hugging Face 端点时max input length 要配到 65536、PAYLOAD_LIMIT调到 8000000参数细节以 README_deploy.md 为准。现象模型在陌生界面里自信地认错元素基于错误推理点了次优目标。原因幻觉是已知局限模糊环境里更容易发生。规避前几步人工抽检并控制任务步数上限用finished()动作显式收尾。另外官方声明开源的 7B 版本侧重通用计算机使用没有针对游戏场景优化游戏类长任务效果弱于完整 UI-TARS-1.5。 延伸入口论文arXiv:2501.12326UI_TARS_paper.pdf云端部署与 API 调用README_deploy.md坐标处理机制详解README_coordinates.md三套 prompt 模板源码codes/ui_tars/prompt.py测试样例与本地解析测试codes/tests/云端跑通第一次推理后把解析层接到你自己的环境里从单任务、单步开始验证坐标落点。论文引用article{qin2025ui, title{UI-TARS: Pioneering Automated GUI Interaction with Native Agents}, author{Qin, Yujia and Ye, Yining and Fang, Junjie and Wang, Haoming and Liang, Shihao and Tian, Shizuo and Zhang, Junda and Li, Jiahao and Li, Yunxin and Huang, Shijue and others}, journal{arXiv preprint arXiv:2501.12326}, year{2025} }代码采用 Apache-2.0 许可证仓库地址https://gitcode.com/GitHub_Trending/ui/UI-TARS【免费下载链接】UI-TARSPioneering Automated GUI Interaction with Native Agents项目地址: https://gitcode.com/GitHub_Trending/ui/UI-TARS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考