这两天在头条上看到不少关于 AI 智能体、Agent Skills 的内容。以前大家说 AI 工具,更多是在问它能不能写一段文字、修一张图、整理一份表格。现在话题变成了:它能不能帮人连续完成一件事。
这个变化对工具测评账号很重要。因为智能体听起来比普通工具更强,但越是这种“能帮你做事”的工具,越不能只看演示效果。
我现在测这类工具,会先看第一个问题:它到底适合哪个场景。是帮内容创作者整理资料,还是帮办公用户处理表格,还是帮商家回复消息?如果一个工具什么都说能做,但没有具体场景,普通用户反而更难判断。
第二个问题是权限边界。智能体如果要读文件、打开网页、调用插件、连接账号,就一定要看它需要哪些权限。工具越自动,越要知道它能碰到哪些数据,哪些步骤需要人工确认。
第三个问题是结果能不能复查。真正好用的工具,不只是把任务跑完,还应该留下过程,让用户知道它用了哪些资料、做了哪些判断、哪里可能需要修改。
所以我不会把智能体工具简单写成“效率神器”。对普通人来说,更实用的测评应该回答:它适合谁,权限是否清楚,结果能不能改。智能体越热闹,测评越要慢一点。