链载Ai

标题: GELab-Zero ,4B 小模型,轻松把你手机变成 AI 手机,实在太强了 [打印本页]

作者: 链载Ai    时间: 5 小时前
标题: GELab-Zero ,4B 小模型,轻松把你手机变成 AI 手机,实在太强了

ingFang SC", Cambria, Cochin, Georgia, Times, "Times New Roman", serif;font-size: 17px;letter-spacing: 0.1em;color: rgb(63, 63, 63);">先把结论说在前面:如果你是做 Python / 后端 / 前端的初级开发,哪怕几乎没碰过“智能体”,GELab-Zero 也是一个可以真正在你电脑上跑起来、帮你点外卖、抢券、刷知乎的移动 GUI 智能体方案,而且是本地可部署的那种。
不是 PPT,不是云里雾里的概念,是能连上你安卓手机,在屏幕上自己点来点去的那种。


ingFang SC", Cambria, Cochin, Georgia, Times, "Times New Roman", serif;display: table;padding: 0px 0.2em;color: rgb(255, 255, 255);background: rgb(51, 51, 51);">为什么是“GUI 智能体”,而不是再做一个 App

ingFang SC", Cambria, Cochin, Georgia, Times, "Times New Roman", serif;font-size: 17px;letter-spacing: 0.1em;color: rgb(63, 63, 63);">这几年,大家都在喊“手机上的智能体”。但真要落地到一个个具体应用上,就会发现有个特别现实的问题:应用生态太碎了。
不同品牌、不同系统版本、各种 UI,各种权限弹窗,真要每个 App 去做 SDK 集成,根本搞不完。

ingFang SC", Cambria, Cochin, Georgia, Times, "Times New Roman", serif;font-size: 17px;letter-spacing: 0.1em;color: rgb(63, 63, 63);">GUI 智能体走的是一条很“笨”,但很实在的路:

ingFang SC", Cambria, Cochin, Georgia, Times, "Times New Roman", serif;font-size: 17px;letter-spacing: 0.1em;color: rgb(63, 63, 63);">这听上去粗糙,但好处是:

GELab-Zero 做的,就是把这一整套“看懂屏幕 + 决定点哪 + 真机执行”的链条做成一个你能直接拿来用的工程模板。


GELab-Zero 解决的是哪几件“脏活累活”

光会“看懂” UI 还不够,真实项目里最烦的是一堆工程细节:

GELab-Zero 很直接:把这些当成“脏活累活”,全部打包了。

它有两个核心部分:

对开发者意味着什么?

说白了,它不是给你一个“模型文件”就完事,而是给你一整条能打通到真机上的流水线。


能力到底咋样?不是嘴上说说,有分数

吹谁都会吹,关键是有没有公开基准来验货。

GELab-Zero-4B-preview 在几个常见 GUI 基准上的表现,挺值得你认真看一下:

这些名字你可能没都用过,但有个直观感受:

对本地部署来说,这个组合挺关键:


它能在手机上干什么?不再是“玩玩而已”

页面上列了一组很具体的任务,看着有点好玩,但其实挺硬核:

这些任务有个共同点:

如果你在做自动化、RPA、测试,或者想做一个“帮用户在手机上操作各种 App 的助手”,这些场景基本可以直接映射到你的业务脑图里。


开发者视角:搭起来其实没你想的那么重

说点你最关心的:我得折腾多久,才能跑通一个任务?

GELab-Zero 给了一个很老实的“快速开始”:

# 克隆仓库
git clone https://github.com/stepfun-ai/gelab-zero
cd gelab-zero

# 安装依赖
pip install -r requirements.txt

# 推理单个任务
python examples/run_single_task.py

当然,现实中你会卡在:

好消息是,这部分它的定位就是“帮你踩过一遍坑”,做成了统一流程:

作为开发者,你暧昧地懂一点这些词是什么意思,但上手写一套完整系统会有点虚。
那就先别想“大一统平台”,照着它现成的例子改需求,先把一个任务跑起来。


AndroidDaily:它考的不是“写邮件”,是“过日子”

普通基准很多都在考“办公生产力”:写邮件、处理文档。
但你真观察自己每天摸手机的场景,会发现:

GELab-Zero 团队搞了一个叫 AndroidDaily 的基准,专门针对这些“真实日常生活场景”:食品、交通、购物、住房、信息消费、娱乐六大类,任务都来自热门 App,强调能产生真实的线上线下结果,比如交易、预订、服务下单。

它有一个“静态测试”子集:

动作类型的分布也挺像我们日常操作手机:

在这个静态基准上,GELab-Zero-4B-preview 准确率 73.4%,
相当于:

这不是说“GPT-4o 不行”,而是说:


你可以怎么用:从“工具”而不是“神话”看它

如果你是一个初级开发者,现在可以先别把它当成什么“下一代操作系统”之类的大词。
更务实一点:当成一个能帮你解决如下问题的“工具箱”:

等你把一个场景跑顺了,再去想:

资源入口也都很直接:


最后说一句稍微主观的感受:
GELab-Zero 这种项目,对初级开发其实挺友好的。
不是因为它“简单”,而是因为它帮你把最恶心的那层工程基建包好了,你反而有机会更快地接触到“智能体 + 真实场景”这一层,而不是死在 ADB 和设备兼容性的坑里出不来。







欢迎光临 链载Ai (http://www.lianzai.com/) Powered by Discuz! X3.5