用AI Agent半年,我踩过的坑比写过的代码还多。今天聊一个真事,给所有把Agent当"全自动打工仔"的人敲个警钟。
就在今天,一个开发者让Claude写了个清理脚本,想自动清掉/tmp下的临时文件。结果Claude的模型被安全机制自动降级后,反而把人家整个家目录700GB的数据全删了——一周的工作成果,没了。最讽刺的是,那个临时文件目录还完好无损地躺在那。
问题出在哪?模型降级后,安全校验逻辑里的变量名跟清理逻辑撞车了。一个变量复用错误,就把"测试产物"指向了你的家目录。更离谱的是:那个号称保护你的安全机制,恰恰是事故的帮凶。
这件事我有三个切身感受:
第一,Agent越"自动",你越不能放手。特别是涉及数据删除、权限变更这类不可逆操作,一定要加人工确认环节。别嫌麻烦——700GB的教训够大了。
第二,成本熔断必须上线就建好。有人的无人值守Agent一夜间烧了两千多块API费用。上下文越滚越大,重试死循环,你不设上限它就替你花。单日额度、实时告警,别等月底对账才发现。
第三,上下文不是垃圾桶。现在模型支持百万token,很多人恨不得把整个知识库塞进去。实测数据告诉你:关键指令放开头5%和结尾5%,中间塞太多反而"失忆"。
我现在的原则很简单:能让人确认的步骤,绝不全自动。
你的AI Agent有没有设过安全边界?踩过什么类似的坑?评论区聊聊你的防护方案。