段 1 · 目标能力
写清模型任务(Coding / Agent / DeepResearch / AI 安全)、期望改进点与失败模式,而非只写「提升效果」。
段 2 · 难度带与跑分
约定 harness 版本、思考强度、4-run / passrate 带;强模型至少一次全对 vs 中弱保留提升空间。页面区间为参考规格。
段 3 · TaskShape
输入/工具/输出 schema、禁止取巧规则、多模字段是否必填;抽检口径写入合同附件。
段 4 · 环境与依赖
Docker/QEMU、密钥与网络 egress、可复现快照;安全盘须隔离与泄漏扫描。
段 5 · 质检门禁
样例批次跑分标定 + 双审/盲评(按品类);一致性指标以合同清单为准,不以营销百分比替代。
段 6 · 分批交付
试点 → 扩量 → 全量;每批附版本号、变更说明与拒收窗口。
段 7 · 订阅与更新
是否含难题子集补丁、评测集轮换、漏洞源白名单更新;清单外来源须书面确认。
填表时写清目标能力与期望规模,顾问按 SOW 七段回方案。枢纽页:ai-coding-datasets。