推理强度越高,就一定越合适吗?
用可复测的小实验选择推理强度:先定义正确答案,再比较通过率、等待时间与单次成功成本。
按失败代价拆任务
把工作分成三组:标题改写、字段抽取、多约束方案推导。改写可以接受几种表达,抽取不能编造字段,推导要同时满足约束。给每组写出失败条件,例如“新增输入中没有的日期”或“预算加总超过上限”。这些条件比“感觉回答更聪明”更能帮助选择模式。
准备一个控制变量实验
每组准备至少 10 个不同样本,锁定模型版本、输入、工具权限和输出上限,仅改变该模型真实支持的推理选项。每个样本跑两遍观察波动。把结果匿名成 A/B 再人工评分,防止看到“高强度”就偏向它。若服务不暴露强度设置,就不能把网页里的不同产品按钮当同参数实验。
样本ID,模型版本,推理选项,是否通过,失败原因,总等待秒数,计费金额
case-001,,,,,,
case-002,,,,,,看每个成功结果的总成本
假设普通模式跑 20 次花 0.4 元,16 次通过,则每次成功平均支出 0.025 元;较高模式花 0.9 元,19 次通过,约 0.047 元。后者更贵但失败更少。若失败会让人花十分钟检查,节省的人工时间也要考虑。这只是演示,不能据此断言任何模式更划算。
如何做升级重试
从能满足多数样本的模式开始。先做字段和规则校验,只有未通过的请求才升级;设置最多一次升级,仍失败交给人工。对外发送和数据库写入放在验证之后,否则重试可能重复执行。任务没有明确校验方法时,不能只靠模型自报“我很有信心”来判断是否升级。
防止两种常见误解
high 不是固定消耗三倍 Token;最大输出上限也不是实际使用量。更长的内部推理不保证事实更准确,缺资料时应补资料,缺权限时应修权限。记录真实 usage 而不是要求模型自述思考过程;将敏感提示词与日志分开保存,测试样本尽量用脱敏数据。
把结论限定在你的任务上
最终写成:“在这批反馈分类样本、此版本和此约束下,普通模式达到我们的通过门槛。”保留失败样本,每次模型升级后重跑。若只测了十几条,就把结论当试运行依据,别写成通用排行榜。模型选型评测文章给出了可直接使用的评分清单。