AI Coding 数据集

AI Coding 数据集 NEW

SWE 长程工程 · 仓库级生成 · 竞赛级难题 · 后训练与偏好对齐

面向 2026 年编码模型与编码 Agent 的前沿需求,覆盖从单文件修复到数天级马拉松式工程的全谱任务,任务口径对齐 SWE-bench Verified/Pro、DeepSWE v1.1、FrontierSWE、LMArena Coding 等主流榜单。每类数据均配套可执行环境、校验脚本与专家标注,可直接用于 SFT/RL 后训练、偏好对齐与能力评测。

数据集目录

板块定位与建设价值

后训练燃料

覆盖 SFT 与 RL 两类后训练信号:既有正确答案轨迹,也有失败轨迹与归因标注,支持 DPO/GRPO 等算法。

榜单同频

任务口径与评估方式对齐 SWE-bench、DeepSWE、FrontierSWE、LMArena Coding 等榜单,训练与评测可同频迭代。

长程能力

从单文件修复到跨模块重构的小时~天级任务,专门补强上下文保持、规划与中途纠错能力。

评测基建

Docker 化环境 + 确定性校验脚本,客户可一键复现评测结果,避免环境与口径争议。

数据与任务构成、规模说明

任务规模

单类任务 3,000–20,000 条起,支持按难度带(Easy/Medium/Hard/Frontier)分层抽样与定制扩容。

语言与仓库

Python/Java/Go/TypeScript/Rust/C++ 六语言;仓库级任务含完整脚手架、单元测试与 CI 配置。

标注粒度

任务级 rubric + 步骤级轨迹 + 代码 diff 三级标注,可训练、可归因、可评估。

难度分布

DeepSWE 类对齐头部模型 65–73% 解决率区间;Ultra Long-horizon 类对齐马拉松式榜单,区分度显著。

典型应用场景

编码模型后训练

为通用大模型补齐真实工程能力,支撑 SFT/RL/偏好对齐全流程训练。

编码 Agent 研发

Claude Code、Codex、opencode 类产品的能力验证与短板定位。

Benchmark 建设

为评测机构与模型厂商共建高区分度、抗污染的私有评测集。

模型选型对比

以统一任务集横向对比候选模型,输出可复现的选型结论。

交付形式与规格参数

交付格式

JSON/JSONL 结构化样本 + 代码仓库快照(含 git history)+ Docker 任务镜像 + 校验脚本。

核心字段

task_id、prompt/issue、repo_snapshot、gold_patch、test_patch、trajectory、rubric、difficulty、metrics。

质检标准

双审标注 + 自动化校验脚本 + 抽检复核,轨迹可复现率与标注一致性均 ≥ 98%。

交付周期

标准品类 2–4 周;仓库级与超长程类 4–8 周;支持分批交付与滚动扩容。

授权与合规

商业使用授权 + 开源协议合规审查 + 敏感信息脱敏,提供完整授权文件。

示例说明

DeepSWE 任务样本结构(节选)
{
  "task_id": "deepswe-00417",
  "repo": "acme-org/serving-core",
  "issue": "多文件联动:连接池泄漏导致长跑 OOM",
  "gold_patch": "diff --git a/pool.py ...",
  "test_patch": "tests/test_pool_leak.py",
  "trajectory": [
    {"step": 1, "action": "grep -R \"Pool(\" src/", "finding": "3 处未释放"},
    {"step": 2, "action": "edit src/pool.py:88", "diff": "..."},
    {"step": 3, "action": "pytest -q", "result": "28 passed"}
  ],
  "difficulty": "hard",
  "metrics": {"resolved": true, "regression": 0, "patch_lines": 42}
}
Coding Arena 偏好样本(节选)
{
  "prompt": "做一个支持多人协作的看板应用,含拖拽与实时同步",
  "candidate_a": {"stack": "React + WebSocket", "artifact": "..."},
  "candidate_b": {"stack": "Vue + SSE", "artifact": "..."},
  "preference": "a",
  "dimensions": {
    "功能完整性": {"a": 5, "b": 4},
    "UI 美观度": {"a": 4, "b": 5},
    "交互流畅性": {"a": 5, "b": 3}
  },
  "annotator_agreement": 0.81
}

需要定制化的 AI Coding 数据方案?

长沙朗慧信息科技有限公司 DataAssetsAPI 平台,支持按任务类型、语言栈、难度带与规模灵活组合,提供样例预览与私有评测集共建。

立即咨询