ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

四步跑通本地演示:用 OmniParser 做纯视觉 GUI 屏幕解析

四步跑通本地演示:用 OmniParser 做纯视觉 GUI 屏幕解析 四步跑通本地演示用 OmniParser 做纯视觉 GUI 屏幕解析【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParserOmniParser 是一款走纯视觉路线的 GUI 屏幕解析工具。丢给它一张界面截图它就回吐一份带编号、带图标标签的元素清单——哪个是搜索框、哪个是按钮、哪段是文字都框得明明白白。它的定位很直接先把屏幕翻译成结构化的元素列表再交给 GPT-4V 这类视觉模型去生成落在具体区域上的动作。它不碰应用内部接口所以软件换了版本、布局挪了位置只要那个按钮还长一个样它照样认得。场景演示让界面元素识别替你记坐标设想你在写一个自动操作脚本要帮用户在 Excel 里点插入、在浏览器里点提交。最省事的做法是记死坐标可窗口一拖、分辨率一变点击就全错了。换成 OmniParser 的思路先截一张屏让它把界面拆成编号元素然后你只告诉模型点 5 号元素模型自己去对号入座。定位这一步交给它你就不用再为布局变化反复改坐标也不怕版本更新把老脚本带崩。核心能力框选加描述一步生成可执行的界面元素清单它把看得准和点得动绑在一起。检测阶段用 YOLOv9 把图标和区域框出来OCR 读出文字再补一句每个图标的功能说明最后拼成一份模型能直接读懂的清单。V2 版本比 V1 快约六成对各种系统和应用里的图标也更好认。想接着往下做它还能跟你自选的视觉模型配合——OpenAI 的 4o / o1 / o3-mini、DeepSeek R1、Qwen 2.5VL、Anthropic Computer Use 都开箱可用再配上 omnitool 里跑在 Docker 中的 Windows 11 虚拟机 OmniBox就能让 AI 真的去点、去输入而不只是看得见。三步在本地跑通 Gradio 演示先拿代码git clone https://gitcode.com/GitHub_Trending/omn/OmniParser进到项目目录。建环境装依赖conda create -n omni python3.12conda activate omni再pip install -r requirements.txt。下模型权重检测器与图标描述权重从 HuggingFace 拉进weights目录检测器取icon_detect_v3/model.pt描述模型放进icon_caption_florence。起演示python gradio_demo.py浏览器打开后上传一张截图就能看到框选结果和元素清单。适用边界与落地建议说句实在的它能跑在 CPU 上想快就上 GPUOmniBox 那套 Windows 虚拟机依赖 KVM主要在 Windows 和 Linux 上跑得顺解析准不准也取决于界面元素在像素上够不够清晰、够不够稳定。它适合做 GUI 自动化、界面巡检、测试脚本也能给 Agent 当眼睛但它不替你决策关键动作最好留一个人工确认。想看效果指标可以翻 docs/Evaluation.md。对只想先体验的人把 Gradio 演示跑起来就是最短的一条上手路径。【免费下载链接】OmniParserA simple screen parsing tool towards pure vision based GUI agent项目地址: https://gitcode.com/GitHub_Trending/omn/OmniParser创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表