Agent 评测与任务环境

Agent 评测与任务环境 HOT

职业级工作流 · 终端环境 · 工具使用 · 端到端流程自动化

面向 2026 年智能体(Agent)能力评测与训练需求,提供 11 类真实、可复现的任务环境数据:从投行/咨询/法律等职业级长程工作流,到终端排障、工具十项全能与企业流程自动化。所有任务均配套环境镜像、状态断言与校验脚本,支持一键复现评测结果。

数据集目录

板块定位与建设价值

真实职业口径

任务源自真实职业交付场景,评分标准由从业专家制定,避免“会考试不会干活”。

环境可复现

任务环境 Docker 化、状态可被脚本断言,评测结果可跨团队复现与横向对比。

高区分度

优先建设当前 SOTA 表现欠佳的方向(TB 3.0 仅 15–26%、AutomationBench 18–30%),拉开模型差距。

训练与评测一体

同一任务既可用于后训练(含金标准轨迹),也可直接作为评测集使用。

数据与任务构成、规模说明

任务规模

单类 1,500–12,000 条任务环境;支持按职业、工具类别、难度分级组合交付。

环境形态

Docker 镜像 / 仿真办公环境 / 真实终端沙箱三类形态,均配套初始化与重置脚本。

标注粒度

任务级目标 + 步骤级动作序列 + 状态断言点 + 评分 rubric 四级标注。

难度分级

按完成率分为 Standard / Hard / Frontier 三档,Frontier 档对齐当前榜单未饱和区间。

典型应用场景

智能体能力评测

为模型厂商与评测机构提供可复现、抗污染的高区分度评测集。

Agent 后训练

以金标准轨迹与断言反馈作为 RL 奖励信号来源,训练真实干活能力。

企业自动化选型

以真实业务流程任务横向对比各 Agent 产品,支撑采购决策。

安全与边界研究

RSI、reward hacking、越权操作等安全相关能力的研究与评估。

交付形式与规格参数

交付格式

任务包(Docker 镜像 + 初始状态)+ 校验脚本 + 金标准轨迹 JSONL + rubric 评分表。

核心字段

task_id、env_image、goal、toolset、assertions、gold_trajectory、rubric、difficulty、metrics。

质检标准

环境可运行率 100%、断言脚本确定性校验、金标准轨迹人工复核通过率 ≥ 98%。

交付周期

标准品类 4–6 周;职业级与终端环境类 6–8 周;支持滚动扩容。

授权与合规

商业使用授权,业务数据全量脱敏,提供数据处理与合规说明文件。

示例说明

Terminal-Bench 3.0 类任务校验脚本(节选)
#!/usr/bin/env bash
set -e
# 断言 1:服务已启动并监听 8080
ss -ltnp | grep -q ":8080" || exit 1
# 断言 2:配置文件已加固
grep -q "PermitRootLogin no" /etc/ssh/sshd_config || exit 1
# 断言 3:回归测试通过
cd /app && pytest -q tests/ | tail -1 | grep -q "passed" || exit 1
echo "PASS"
Toolathlon 工具调用金标准(节选)
{
  "task_id": "toolathlon-0213",
  "goal": "查上周订单总额并生成对账表格邮件给财务",
  "gold_sequence": [
    {"tool": "db.query", "args": {"range": "last_week"}},
    {"tool": "sheet.create", "args": {"from": "$1.result"}},
    {"tool": "mail.send", "args": {"to": "finance@corp.com", "attach": "$2.file"}}
  ],
  "fallbacks": [{"on_error": "$2", "action": "retry with csv export"}],
  "metrics": {"end2end": true, "redundant_calls": 0}
}

需要定制化的 Agent 评测环境?

长沙朗慧信息科技有限公司 DataAssetsAPI 平台,支持按职业、工具生态、难度带与环境形态灵活组合,提供样例环境预览与私有评测集共建。

立即咨询