Agent 评测与任务环境 HOT
职业级工作流 · 终端环境 · 工具使用 · 端到端流程自动化
面向 2026 年智能体(Agent)能力评测与训练需求,提供 11 类真实、可复现的任务环境数据:从投行/咨询/法律等职业级长程工作流,到终端排障、工具十项全能与企业流程自动化。所有任务均配套环境镜像、状态断言与校验脚本,支持一键复现评测结果。
职业级工作流 · 终端环境 · 工具使用 · 端到端流程自动化
面向 2026 年智能体(Agent)能力评测与训练需求,提供 11 类真实、可复现的任务环境数据:从投行/咨询/法律等职业级长程工作流,到终端排障、工具十项全能与企业流程自动化。所有任务均配套环境镜像、状态断言与校验脚本,支持一键复现评测结果。
任务源自真实职业交付场景,评分标准由从业专家制定,避免“会考试不会干活”。
任务环境 Docker 化、状态可被脚本断言,评测结果可跨团队复现与横向对比。
优先建设当前 SOTA 表现欠佳的方向(TB 3.0 仅 15–26%、AutomationBench 18–30%),拉开模型差距。
同一任务既可用于后训练(含金标准轨迹),也可直接作为评测集使用。
单类 1,500–12,000 条任务环境;支持按职业、工具类别、难度分级组合交付。
Docker 镜像 / 仿真办公环境 / 真实终端沙箱三类形态,均配套初始化与重置脚本。
任务级目标 + 步骤级动作序列 + 状态断言点 + 评分 rubric 四级标注。
按完成率分为 Standard / Hard / Frontier 三档,Frontier 档对齐当前榜单未饱和区间。
为模型厂商与评测机构提供可复现、抗污染的高区分度评测集。
以金标准轨迹与断言反馈作为 RL 奖励信号来源,训练真实干活能力。
以真实业务流程任务横向对比各 Agent 产品,支撑采购决策。
RSI、reward hacking、越权操作等安全相关能力的研究与评估。
任务包(Docker 镜像 + 初始状态)+ 校验脚本 + 金标准轨迹 JSONL + rubric 评分表。
task_id、env_image、goal、toolset、assertions、gold_trajectory、rubric、difficulty、metrics。
环境可运行率 100%、断言脚本确定性校验、金标准轨迹人工复核通过率 ≥ 98%。
标准品类 4–6 周;职业级与终端环境类 6–8 周;支持滚动扩容。
商业使用授权,业务数据全量脱敏,提供数据处理与合规说明文件。
#!/usr/bin/env bash set -e # 断言 1:服务已启动并监听 8080 ss -ltnp | grep -q ":8080" || exit 1 # 断言 2:配置文件已加固 grep -q "PermitRootLogin no" /etc/ssh/sshd_config || exit 1 # 断言 3:回归测试通过 cd /app && pytest -q tests/ | tail -1 | grep -q "passed" || exit 1 echo "PASS"
{
"task_id": "toolathlon-0213",
"goal": "查上周订单总额并生成对账表格邮件给财务",
"gold_sequence": [
{"tool": "db.query", "args": {"range": "last_week"}},
{"tool": "sheet.create", "args": {"from": "$1.result"}},
{"tool": "mail.send", "args": {"to": "finance@corp.com", "attach": "$2.file"}}
],
"fallbacks": [{"on_error": "$2", "action": "retry with csv export"}],
"metrics": {"end2end": true, "redundant_calls": 0}
}长沙朗慧信息科技有限公司 DataAssetsAPI 平台,支持按职业、工具生态、难度带与环境形态灵活组合,提供样例环境预览与私有评测集共建。
立即咨询