经常有人说,只要不断地复盘错误沉淀进 skill,就能让任务完成得越来越好……举个例子吧,我的旅行攻略有一项子任务是 “旅途中每天手动刷新天气卡片”,规则非常清晰:1、 调用天气 skill 读取可靠信源。2、 优先调用目的地当地的天气预报,没有数据时可调用权威天气预报,对于远期没有预报的数据,采用历史数据拟合。3、天气预报必须包含降雨预测与日落时间,分析天气因素(尤其是日落时间)对于行程的影响。
规则清晰明了,大模型抵死不从。
有时候他不读取准确的天气数字,含混其辞;有时候他不读取当地天气数据,而是读取低权重的权威天气预报,甚至直接历史数据拟合;有时候他不跟我讲日落时间,或者不从日落时间的角度来分析今日行程。
以上错误反反复复地犯,修好以后问他规则不清晰吗?他说清晰的。问他有什么不再复发的方案吗?加了几项校验,但依然会复发。每天刷新天气卡片都像是开盲盒,不知道今天开出来什么。
🤷♂️
只能说,当我的旅行攻略复杂到了几千个细节的地步,大模型在细节上出错就是百分百的概率。改进这一点必须采用工程技巧解耦执行,或者用代码来实现约束,对我来说有点超纲。