‹ 返回随想 Esc

Agent 产品的真实可用性

能演示不等于能托付,agent 需要稳定处理脏现实。

很多 agent 产品演示很惊艳,但真实可用性要看它如何处理脏现实:网页变了、权限不够、网络失败、数据冲突、用户临时改主意。人类助理的价值不是只会按流程走,而是知道何时停下来确认。Agent 也一样,可靠的暂停比自信的误操作更重要。

我自己试过几个 agent 工具,发现它们在理想路径上跑得很快,但一遇到异常就暴露短板。比如让它帮我填一个表单,页面加载慢了几秒它就开始乱点;让它整理文件,遇到同名文件就卡住不动。这些都不是大问题,但积累起来就让人不敢把重要任务交给它。

最让我在意的是错误恢复能力。人犯错后能意识到”不对,刚才那个操作有问题”,然后回退。Agent 往往是错了继续错,甚至把错误当成正确结果汇报给你。所以我在评估 agent 产品时,会故意制造一些干扰:中途改需求、临时断网、给一个模糊指令,看它怎么反应。能优雅处理异常的产品才值得长期用。

数据安全也是绕不开的问题。Agent 要完成任务就得接触你的数据——文件内容、浏览器历史、API 密钥。我想知道这些数据会不会被上传到云端训练模型,任务完成后能不能彻底清除。这不是 paranoia,而是基本的数字卫生习惯。

评论