AI Coding 数据集 NEW
SWE 长程工程 · 仓库级生成 · 竞赛级难题 · 后训练与偏好对齐
面向 2026 年编码模型与编码 Agent 的前沿需求,覆盖从单文件修复到数天级马拉松式工程的全谱任务,任务口径对齐 SWE-bench Verified/Pro、DeepSWE v1.1、FrontierSWE、LMArena Coding 等主流榜单。每类数据均配套可执行环境、校验脚本与专家标注,可直接用于 SFT/RL 后训练、偏好对齐与能力评测。
SWE 长程工程 · 仓库级生成 · 竞赛级难题 · 后训练与偏好对齐
面向 2026 年编码模型与编码 Agent 的前沿需求,覆盖从单文件修复到数天级马拉松式工程的全谱任务,任务口径对齐 SWE-bench Verified/Pro、DeepSWE v1.1、FrontierSWE、LMArena Coding 等主流榜单。每类数据均配套可执行环境、校验脚本与专家标注,可直接用于 SFT/RL 后训练、偏好对齐与能力评测。
覆盖 SFT 与 RL 两类后训练信号:既有正确答案轨迹,也有失败轨迹与归因标注,支持 DPO/GRPO 等算法。
任务口径与评估方式对齐 SWE-bench、DeepSWE、FrontierSWE、LMArena Coding 等榜单,训练与评测可同频迭代。
从单文件修复到跨模块重构的小时~天级任务,专门补强上下文保持、规划与中途纠错能力。
Docker 化环境 + 确定性校验脚本,客户可一键复现评测结果,避免环境与口径争议。
单类任务 3,000–20,000 条起,支持按难度带(Easy/Medium/Hard/Frontier)分层抽样与定制扩容。
Python/Java/Go/TypeScript/Rust/C++ 六语言;仓库级任务含完整脚手架、单元测试与 CI 配置。
任务级 rubric + 步骤级轨迹 + 代码 diff 三级标注,可训练、可归因、可评估。
DeepSWE 类对齐头部模型 65–73% 解决率区间;Ultra Long-horizon 类对齐马拉松式榜单,区分度显著。
为通用大模型补齐真实工程能力,支撑 SFT/RL/偏好对齐全流程训练。
Claude Code、Codex、opencode 类产品的能力验证与短板定位。
为评测机构与模型厂商共建高区分度、抗污染的私有评测集。
以统一任务集横向对比候选模型,输出可复现的选型结论。
JSON/JSONL 结构化样本 + 代码仓库快照(含 git history)+ Docker 任务镜像 + 校验脚本。
task_id、prompt/issue、repo_snapshot、gold_patch、test_patch、trajectory、rubric、difficulty、metrics。
双审标注 + 自动化校验脚本 + 抽检复核,轨迹可复现率与标注一致性均 ≥ 98%。
标准品类 2–4 周;仓库级与超长程类 4–8 周;支持分批交付与滚动扩容。
商业使用授权 + 开源协议合规审查 + 敏感信息脱敏,提供完整授权文件。
{
"task_id": "deepswe-00417",
"repo": "acme-org/serving-core",
"issue": "多文件联动:连接池泄漏导致长跑 OOM",
"gold_patch": "diff --git a/pool.py ...",
"test_patch": "tests/test_pool_leak.py",
"trajectory": [
{"step": 1, "action": "grep -R \"Pool(\" src/", "finding": "3 处未释放"},
{"step": 2, "action": "edit src/pool.py:88", "diff": "..."},
{"step": 3, "action": "pytest -q", "result": "28 passed"}
],
"difficulty": "hard",
"metrics": {"resolved": true, "regression": 0, "patch_lines": 42}
}{
"prompt": "做一个支持多人协作的看板应用,含拖拽与实时同步",
"candidate_a": {"stack": "React + WebSocket", "artifact": "..."},
"candidate_b": {"stack": "Vue + SSE", "artifact": "..."},
"preference": "a",
"dimensions": {
"功能完整性": {"a": 5, "b": 4},
"UI 美观度": {"a": 4, "b": 5},
"交互流畅性": {"a": 5, "b": 3}
},
"annotator_agreement": 0.81
}长沙朗慧信息科技有限公司 DataAssetsAPI 平台,支持按任务类型、语言栈、难度带与规模灵活组合,提供样例预览与私有评测集共建。
立即咨询