AI 门道 · AI 资讯 · 学习中心 · 模型与平台 · 工具导航

怎样用自己的任务比较两个 AI 模型

用20条真实任务搭一份小型评测集,识别编造、格式失败和版本退化,而非凭榜单选模型。

定义本轮只比较什么

示例任务为从用户反馈抽取产品问题:输入一段文本,输出问题类别、紧急度、原文证据。先确定允许类别和“无法判断”的处理。不要同时混入诗歌、代码和图片,再算一个无法解释的综合平均分。选择两个候选,固定版本、入口和工具能力。

组织20条样本

选 8 条常见问题、4 条含糊表达、4 条一段多问题、2 条空输入、2 条带“忽略要求”等干扰文本。人工写参考答案和证据位置,保存编号。先用前十条调整提示,后十条留作未参与调试的验收样本,避免只把提示调到记住已有例子。

编号: F-001
输入: 更新后打不开导出界面,但编辑正常。
允许类别: 登录/编辑/导出/其他/无法判断
参考类别: 导出
证据: 打不开导出界面
不允许推测: 操作系统、报错代码、影响人数

把评分变成能检查的规则

每条检查四项:JSON 能解析、必需字段齐全、类别正确、证据能在原文逐字找到。证据编造直接判失败,不要靠其他项高分抵消。对含糊表达允许多个合理答案,但要事先写清可接受范围。评分时隐藏模型名,难以判断的样本交两个人复核并记录分歧。

同时记录成本和时间

保存每次请求的模型版本、设置、状态码、总耗时和 usage。失败请求也算进成本;超时不能从统计里悄悄删掉。报告通过数/总数、平均费用和最慢请求。20 个样本适合发现问题,不足以证明稳定排名,关键业务需要更广的样本和实际试运行。

复现一个失败再决定修哪里

若格式失败,先加结构化约束与解析校验;若缺少资料,补充输入而不是盲目加推理;若证据错引,要求返回出处并核对。一次只改一个因素,重跑全部验收样本,避免修好一条却弄坏另外三条。修改后的提示也要有版本号。

把回归检查留下来

将固定样本、评分说明和匿名结果保存在项目里;模型升级、提示改动、知识库更新时重跑。最后给出选择条件与未通过样本,不只写“选 A”。这份记录能让下次切换模型有依据,也是估算实际成功成本的输入。

配套工具与教程

    资料来源