技术会换,私有评测集不会换
一句话:技术一直在变。要快速验证它对业务有没有帮助,靠一套带充分上下文的私有评测集。 原文:/posts/eval-set-outlasts-the-model/
主张
- 技术(模型、Harness)会不停换,接进链路很快。真正要快的是:验证它对业务有没有帮助。
- 验证靠一套带充分上下文的私有评测集。公开榜和厂商工作流评测量的是别人的题。
- 现场:20 条真实钉钉入站消息 × 3,上下文分层。对照 qwen3.8-max。正确率 53/60 vs 48/60,Jev 实账单大约二十三分之一,三次一致性 Jev 20/20。半天之内对「这格帮没帮上忙」有读数。
- 新模型来了,先用你的私有评测集过一轮。没有的话,就从自己的聊天记录抄二十句真题,把上下文固定住。
外部证据
- TypeSafe 发布文:Jev 吃进状态、吐出结构化决策。
- OpenRouter TypeSafe SDK:这次对照经 OpenRouter 调用。
- SWE-bench:公开榜量的是模型在那类任务上通不通。
- 20×3 对照是作者自己的现场,正文里的数以那次运行为准。内部报告不外链。
作者自己留的开口
- 尺子只有 20 条、一个岗位、入站去向这一格。换一个业务要另出一套题。
- Jev 走公网、对照走内网;成本一边刊例一边实账单。
- 换不换模型这篇不下决定。
- Case 怎么写、字段怎么留、失败怎么归因,另文再写。