先说为什么要测这一件事
去年有段时间,我被问得最多的一句话是:AI 操作手机到底能顶多少人力。
这个问题很难直接回答,因为答案取决于你把什么活交出去。同样一套东西,有人用了省下一个人工,有人用了多出一个每天要盯的环节。差别不在软件上。
所以今年六月我干脆做了一次对照测试。22 台 iPhone,同一批任务,一半交给原有的苹果群控脚本跑,一半交给 AI 层跑,连续三周,每天记录耗时、失败次数和人工介入的时长。
结论放在最前面:三类活交给 AI 有明显的收益,两类活交给 AI 是负收益。整体上每天的纯操作时间从 5 小时 40 分压到 1 小时 50 分左右,但这个数字的前提是任务挑对了,硬塞进去的那部分反而更慢。
iOS群控这几年最大的变化不在设备层,在任务层。这篇把测试过程和三周的记录摊开讲。
测试是怎么做的
先说清楚条件,不然这些数字没意义。
设备是 22 台 iPhone,同一批次,型号统一,系统版本统一。接入方式走数据线直连,用带独立电源的集线器分成三组挂在两个 USB 控制器上。选择直连的原因很简单:设备摆在架子上不挪窝,用不上蓝牙板或者 OTG 板,也省掉配对的麻烦。如果设备需要挪动,或者不想为每台手机拉一根线,iPhone 还有走局域网的无线版,后面单独讲。
账号结构是三种:4 个主号人工运营,16 个矩阵号跑批量任务,2 个试探号用来试新流程。任务清单从过去一个月的实际工作里整理出来,一共 11 项,覆盖内容发布、订单巡检、评论回复、素材同步、数据记录这几类。
对照方式是把同一批任务复制成两套。A 组用原有脚本跑,B 组用 AI 层跑,账号和设备对半分。每天记录三个数:完成耗时、失败次数、人工介入时长。
有一点要先说明:这不是学术测试,是我自己业务里的一次对照。样本不大,结论只适合拿来参考,不适合当成通用数据。
五个指标,AI 层赢了三项
三周跑完,把两边的表现按五个维度打分。
| 指标 | 脚本层 | AI 层 | 说明 |
|---|---|---|---|
| 界面变动后的存活 | ★★ | ★★★★★ | 脚本改版就得重录,AI 靠识别内容执行 |
| 首条流程的搭建时间 | ★★★★ | ★★ | 脚本录制半天能出三条,AI 要把任务说细 |
| 稳定流程的失败率 | ★★★★★ | ★★★★ | 固定的活脚本更稳,AI 略高但可接受 |
| 处理临时任务 | ★ | ★★★★★ | 脚本为临时任务写一遍不划算 |
| 执行记录的可读性 | ★★★ | ★★★★ | AI 会写下每一步的判断依据 |
最反直觉的是第二项。原以为 AI 更快,实际第一周几乎全花在把任务说清楚上。反而是第三项比预期好,AI 在固定流程上的失败率没有想象中那么高,前提是流程本身写得清楚。
第一周:时间花在把话说清楚
第一周基本没有产出,全在调指令。
举一个具体的例子。我们最初写的任务是「处理一下售后消息」,跑出来的结果一半是错的。原因很好理解:它不知道哪些消息算售后、退款金额到多少需要升级、遇到物流查询该不该回。这些规则在我们脑子里是常识,写出来才发现从来没被说清楚过。
第二版把规则补上之后,正确率从五成提到八成多。第三版又加了两条兜底规则,比如「拿不准的一律标记待人工」,才到九成以上。
这一周的教训是:AI 层的成本不在软件上,在你把业务规则写成文字的时间上。这段时间一次性花掉,后面就一直是收益。
脚本那边第一周很轻松,录制加调试,三条流程一天就出来了。但第二周开始,两个 App 更新了界面,其中一条流程整条失效,重新录了一遍。
第二周:真正省时间的只有三类活
跑完两周,我们把 11 项任务按收益分了三档。
第一档是真正值得交出去的,一共三项:矩阵号的内容发布、评论区回复、素材从网盘同步到手机相册。共同特征是单次一两分钟、一天要做几十次、而且位置不固定。
这三项在 AI 层的日均处理量是脚本层的两倍多,主要差距在失败重试上。评论回复这类活会遇到大量异常情况:有人发广告、有人重复刷屏、有人问的问题在知识库里没有。脚本遇到这些只能跳过,AI 能按规则分类处理。
第二档是交给谁都行的,四项:定时发布、订单巡检、数据记录、指定关键词的批量操作。这类活位置固定、步骤固定,脚本跑得好好的,AI 也能跑,收益差别不大。我们最后保留了脚本方案,因为已经跑熟了。哪些活该留在脚本侧、哪些该交给 AI,这两者的分工里有一条更细的界线。
第三档是不该交出去的,四项:涉及金额的退款审批、需要看图片判断的售后、跨平台的比价、以及所有需要临场判断的沟通。这些硬塞给 AI 的结果是人工介入更多了,因为每天要处理它标错的那些。
第三周:人力账摊开算
第三周数据稳定下来了,把三类活的时间合并算一笔账。
| 任务 | 人工耗时 | 脚本方案 | AI 方案 |
|---|---|---|---|
| 内容发布(16 个号) | 3 小时 20 分 | 40 分钟 | 25 分钟 |
| 评论回复(16 个号) | 1 小时 40 分 | 55 分钟(异常略过) | 35 分钟 |
| 素材同步 | 40 分钟 | 15 分钟 | 12 分钟 |
| 合计 | 5 小时 40 分 | 1 小时 50 分 | 1 小时 12 分 |
看这张表要注意两件事。
一是脚本方案和 AI 方案的差距没有想象中大。真正把 5 小时 40 分压到 1 小时 50 分的是自动化这一层,不是 AI 这一层。AI 额外省下的 38 分钟,主要来自异常处理和临时任务。
二是这张表里没有算维护时间。三周里脚本那边因为界面更新重录了两次,合计约 3 小时;AI 那边没重录,但补充规则花了约 1 小时。把这部分摊到每天,两边差不多各差十几分钟。
所以更准的说法是:AI 层的价值不在日常节省的绝对时长上,而在「界面变了不用重来」和「临时任务不用另写一套」。
哪些活别交给 AI
测试里踩得最狠的一类,是涉及钱的判断。
我们试过把退款审批交给 AI,规则写得也算细了。跑了一周之后停下来,原因是它标错的那些单子需要人去核对,核对的时间比直接审批还长。更要紧的是心理成本:知道有个环节可能出错,人反而更紧张。
另一类是必须看图的售后。开箱损坏、货不对板这类,判断依据在图片里,AI 能描述图片内容,但做不了「这个划痕算不算质量问题」这种判断。这类活我们改成了 AI 先归类、人工再判,只让它做前一半。
第三类是账号安全相关的动作。改密码、换绑、异地登录这类操作,出了问题的代价不是重跑一次,是账号本身。这些不管自动化到什么程度,都建议留人工。防风控那份清单里列的动作,都可以拿来当这类判断的参照。
如果不想拉线,还有无线这条路
测试里 22 台全部走数据线,是因为设备摆在架子上不挪窝,线一次拉好就不用再管。但这套接法有个前提:你得有地方摆架子,还得接受 22 根线配三台集线器。
iPhone 还有另一种接法,走局域网。装好之后,电脑和手机在同一个 WiFi 里就能连上,日常任务不用插线。装的时候仍然要插一次 USB,装手机端程序、刷开发者镜像、绑授权这几步都得有线,绑好之后就可以拔掉。
这一条对成本的影响比看上去大。数据线和带独立电源的集线器,是矩阵里最容易坏、最容易出问题的两样东西。线上的活少了,机房那一堆东西也跟着少。
有几个地方第一次装容易绕:
设备不用固定在一个地方。这是无线最大的好处,手机可以放在不同房间甚至不同楼层,只要和电脑在同一个局域网里。测试里之所以不用它,纯粹是因为那批手机本来就不动。
授权类型别选错。无线版绑的是脱机设备授权,和 USB 版的 USB 设备授权是两种,弄混了跑不起来。
装的时候认准名称。下载器欢迎页里,无线版对应的选项叫 iOS 脱机版本,群控端是 iOS 脱机无线群控投屏,工作站扫描时选的是 iOS 脱机版。同一个东西在三处叫法不同,第一次装最容易在这里打转。
网络要稳。有线怕的是线松,无线怕的是信号差。手机和路由器之间隔得太远,扫描会扫不到设备。
成本这块要算三笔
第一笔是设备和硬件。22 台二手机加线材、集线器、架子,一次性的部分。这部分跟用不用 AI 没关系,是自动化本身的门槛。如果走上面说的无线版,线材和集线器这两项基本可以省下来,架子也不用按台数配。
第二笔是软件和授权。设备授权按手机收,分设备授权和投屏授权两种,别买错。软件本身可以免费,模型 API Key 自己填,费用自理。测试里 B 组用的就是 iEasyRun 这套 AI 工作站,它的收费口径也是这样:工作站免费,跑自动化要绑 USB 设备授权,模型走你自己填的服务。
第三笔是模型调用。这一笔最容易被高估。存成工作流之后重复执行不消耗模型的调用量,只有现场规划的时候才用得上。我们三周的模型费用很低,因为跑的大多是固定流程。
真正该防的是把三笔算成两笔。第一笔和第二笔是固定的,第三笔反而可控。
结论:值不值
回到最初那个问题,AI 操作手机能顶多少人力。
按这次测试的口径:如果手上的活以固定流程为主,AI 层的增量收益大约是每天半小时到一小时,省下的主要是维护时间,也就是界面更新后不用重录的那部分。
如果手上有大量位置会变、需要临场判断的活,比如评论回复、消息分类、异常处理,那增量收益会大得多,因为这类活以前根本没法自动,只能靠人。
值不值的判断标准,可以简化成一句话:你手上有没有那种「步骤说不清、位置总在变」的重复工作。有,这层就值;没有,先把已有的自动化跑稳就够了。
常见问答
加一层 AI 会不会和原有的苹果群控脚本冲突?不会,两类活分开跑。测试里我们把固定流程留在脚本层,把会变的活交给 AI 层,两边同时在 22 台设备上跑,没出现互相干扰。
AI 操作手机是不是一定要联网?任务是本地调度的,设备连在你自己电脑上,执行记录也留在本机。模型推理要走你填的服务,这部分需要联网。
跑一条已经存好的流程要花多少钱?不花钱。重复执行保存好的工作流不消耗大模型调用量,只有让它现场规划才用得上模型。
三周里失败最多的环节是什么?评论回复里的异常消息。发广告、刷屏、问知识库以外的问题,这三类占了失败记录的六成以上,后来靠补充规则压下去了。
需不需要专门招人维护?测试里没有。补充规则、看执行记录这些事,原来的运营顺手就做了,每天大概多花二十分钟。规模再大可能就需要专人。
22 台设备稳定吗?稳定,前提是供电。中途因为集线器没有独立电源掉过几次线,换成带电源的之后三周没再出问题。散热也要注意,架子中间留空隙。
和我们原来的脚本方案比,最大的差别是什么?界面更新之后不用重录。三周里脚本重录两次、每次一个多小时,AI 那边只花时间补规则,没有重来过。
小团队能不能用?能。测试里的规则补充都是原来的运营写的,没有写代码。
最后
这次测试最大的收获,不是那个 5 小时 40 分变成 1 小时 50 分,是搞清楚了哪些活不该自动化。
我们一开始把 11 项任务全部分了自动化的想法,结果第三档那四项全退了回来,中间浪费了将近一周。挑任务这件事,比挑工具重要得多。
如果打算试,建议从一个平台、一台手机、一件小事开始。跑通之后你自然会知道下一件该放什么进来。急着一次铺开二十台,多半会在第一周就放弃。
想看这套 AI 层怎么搭起来,可以从不用写脚本做手机自动化开始,安装的图文步骤在 iEasyRun 的 iOS USB 安装说明里;想算自己规模的账,成本测算那篇里的口径可以直接套;选型的判断标准在苹果群控系统选型指南里。
关于 EasyClick:手机自动化 AI 智能体平台,覆盖安卓免 root、iOS 免越狱、鸿蒙 Next 三大生态,提供脚本开发、苹果群控、本地中控投屏与云控系统。→ 了解全部产品
想要真实跑起来?
本文介绍的方案均可在 EasyClick 手机自动化平台落地。官网提供完整文档、开发工具与群控云控产品,免费体验。