对标 LexKairos(arXiv:2608.09106, 2026年8月),构建中文法律领域的法律时序能力综合基准数据集。从法规时序知识、案例时序建模、法规-案例时序推理三个维度进行标注,支撑法律大模型在时间维度上的推理能力训练。
LexKairos 基准(arXiv:2608.09106, 2026年8月发布)是首个面向中文法律领域的法律时序能力综合基准,揭示了当前法律大模型在处理"法律何时生效""法规修订后旧案如何适用""法规之间时序冲突如何解决"等时序推理问题上的严重不足。
该研究从三个维度评估法律时序能力:
朗慧科技基于 LexKairos 框架,扩展构建覆盖 15 万样本的中文法律时序推理标注数据集,填补国内法律 AI 时序推理训练数据的空白。
标注法规全生命周期时间线,含颁布日期、生效日期、修订历史(含修订前后条文对比)、废止日期、过渡条款、溯及力条款。
标注案件时间轴与法规时间窗口的匹配关系,含案件事实时间、立案时间、审理时间、适用法规版本、时间冲突标注。
标注从"法规时效判断→时间窗口匹配→法不溯及既往检验→最终适用结论"的完整时序推理链,含推理步骤、法律依据、中间结论。
| 字段名 | 类型 | 说明 |
|---|---|---|
| dataset | string | 数据集标识,固定为 "legal-temporal-reasoning" |
| sample_id | string | 样本唯一编号,格式 "LTR-2026-XXXXXX" |
| dimension | enum | 时序推理维度:law_temporal / case_temporal / cross_temporal |
| law_info | object | 法规时序信息对象(含 law_id, title, promulgate_date, effective_date, revise_history, abolish_date) |
| case_info | object | 案件时序信息对象(含 case_id, fact_date, filing_date, trial_date, applicable_law_version) |
| temporal_conflict | boolean | 是否存在时间冲突(如案件发生在法规修订前但审理在修订后) |
| retroactivity | enum | 溯及力判定:retroactive / non_retroactive / transitional_clause |
| reasoning_chain | array | 时序推理链数组,每步含 step, legal_basis, conclusion |
| final_applicable_law | object | 最终适用法规(含 law_id, version, article_range, effective_at_trial) |
| annotator | string | 标注员编号 |
| reviewer | string | 审核员编号 |
| confidence | float | 标注置信度 0.0-1.0 |
从国家法律法规数据库抽取法规全生命周期时间戳,构建法规版本快照(修订前后条文对比),标注效力位阶与时间冲突。
从裁判文书中抽取案件事实时间、立案时间、审理时间,建立案件时间轴,匹配适用法规的时间窗口。
识别案件事实时间与审理时间是否跨越法规修订节点,判定法不溯及既往原则的适用,标注过渡条款与例外情形。
由执业律师标注完整时序推理链(含法律依据、中间结论、最终适用法规),法学教授进行二审,争议样本经合议标注。
对标 LegalGraphRAG(ACL 2026, pp. 37455-37484),构建分层法律知识图谱(HierarGraph)标注数据集。采用多智能体证据推理框架(Researcher-Auditor-Adjudicator),将法律知识组织为层次化图结构,实现可靠的图检索增强法律推理。
LegalGraphRAG(ACL 2026 Long Paper)提出了两层架构解决法律 RAG 系统的可靠性问题:
将法律知识组织为层次化图结构,解耦历史案例、相关法规和司法解释三类知识源,支持多跳图检索。
Researcher(检索证据)→ Auditor(严格验证)→ Adjudicator(综合判决),三角色协作完成法律推理。
实验在 14,049 案例图语料和 568 案例 CAIL 评估集上验证,多智能体图检索显著优于传统 dense retrieval。朗慧科技基于该框架构建 8 万节点的中文法律知识图谱标注数据集。
从分层法律图中检索相关证据节点,标注检索路径、证据相关度评分、候选证据集合。
严格验证 Researcher 检索的证据,标注证据可信度、时效性、适用范围、矛盾检测。
综合验证后的证据进行推理,标注推理链、法律适用结论、置信度评估。
| 字段名 | 类型 | 说明 |
|---|---|---|
| dataset | string | 数据集标识,固定为 "legal-graph-rag" |
| graph_id | string | 图谱唯一编号,格式 "LGR-2026-XXXXXX" |
| query | string | 法律查询问题(自然语言) |
| hierar_graph | object | 分层法律图对象(含 nodes, edges, layers) |
| nodes | array | 图节点数组,每节点含 node_id, type(case/law/interpretation), content, layer |
| edges | array | 图边数组,每边含 source, target, relation(cites/supersedes/interprets/applies_to), weight |
| researcher_output | object | Researcher 标注(含 retrieved_nodes, retrieval_paths, relevance_scores) |
| auditor_output | object | Auditor 标注(含 verified_nodes, trust_scores, contradictions, temporal_validity) |
| adjudicator_output | object | Adjudicator 标注(含 reasoning_chain, final_answer, confidence, legal_basis) |
| ground_truth | string | 标准答案(专家标注) |
从裁判文书、法律法规、司法解释三源数据中抽取法律实体节点,建立案例层、法规层、解释层三层图结构,标注节点间引用、修改、解释、适用等关系边。
针对法律查询问题,标注从图中检索相关证据节点的路径、相关度评分(0-1)、候选证据集合,记录多跳检索过程。
对 Researcher 检索的证据进行严格验证,标注可信度、时效性(法规是否当前有效)、矛盾检测(证据间是否存在冲突)。
综合验证后的证据进行法律推理,标注完整推理链、最终结论、置信度评估、法律依据列表,与专家标准答案对比。
对标 CaseFacts(ACL 2026 Long Paper),构建法律事实核查与先例检索专用基准数据集。包含案件事实验证、证据链完整性评估、先例匹配正负样本标注,支撑法律事实核查 AI 训练与法律 RAG 系统评估。
CaseFacts(ACL 2026 Long Paper, Putta et al.)是首个针对法律领域事实核查和先例检索的专用基准,填补了通用事实核查基准在法律场景中的空白。该研究揭示了:
结合 PLAWBENCH(ACL 2026, 面向真实法律实践的量规评估基准)和 HEC Paris AI 幻觉案例数据库(2026年7月,1,809 件全球法院裁决涉及 AI 虚构内容),朗慧科技构建覆盖法律事实核查全链路的标注数据集。
验证案件陈述事实是否与裁判文书原始记载一致,检测事实歪曲与编造。
评估证据链是否完整,是否存在证据缺失、证据矛盾、非法证据排除。
标注案件与先例的正负样本对,含类案匹配、区分案例、先例效力层级。
验证法律引文(法条、案例号)是否真实存在、引用是否准确、是否断章取义。
标注 AI 生成法律内容中的幻觉(虚构法条、编造案例号、错误适用法规),对标 ABA 幻觉率 17%-33% 研究。
| 字段名 | 类型 | 说明 |
|---|---|---|
| dataset | string | 数据集标识,固定为 "legal-fact-checking" |
| sample_id | string | 样本唯一编号,格式 "LFC-2026-XXXXXX" |
| check_dimension | enum | 核查维度:fact_verification / evidence_chain / precedent_match / citation_check / hallucination_detect |
| claim | string | 待核查的法律陈述(自然语言) |
| label | enum | 核查结论:verified(已验证)/ refuted(已反驳)/ partially_verified(部分验证) |
| evidence | array | 证据数组,每条含 source, content, relevance, credibility |
| error_type | enum | 错误类型(负面样本):fabricated_law / fabricated_case / distorted_fact / out_of_context / broken_chain / none |
| precedent | object | 先例匹配信息(含 precedent_case_id, match_type, similarity_score, court_level) |
| reasoning | string | 核查推理过程(从证据到结论的推理链) |
| confidence | float | 标注置信度 0.0-1.0 |
从裁判文书、法律问答、AI 生成内容中采集真实法律陈述作为正面样本;由法律专家构造注入错误的负面样本(虚构法条、篡改事实、断章取义等)。
从国家法律法规数据库、裁判文书网检索支撑证据,标注证据来源、相关度、可信度,验证法律陈述与原始法律文本的一致性。
为每个样本标注匹配的先例案例(含正负样本),对负面样本进行错误类型分类(fabricated_law / fabricated_case / distorted_fact / out_of_context / broken_chain)。
标注从证据到核查结论的完整推理过程,由执业律师进行初审、法学教授终审,争议样本提交合议庭标注,确保标注质量。
标注员初审→审核员复审→法律专家终审,每级独立标注,分歧超阈值进入合议。
10% 样本双盲交叉标注,计算 Cohen's Kappa 一致性系数,要求 κ ≥ 0.80。
预置 1,000 条专家标注黄金集,每批标注完成后进行自动化验证,准确率要求 ≥ 95%。
训练法律事实核查 AI,自动验证法律陈述的真实性,检测 AI 生成内容中的幻觉与错误,对标 ABA 幻觉率 17%-33% 研究的治理需求。
作为法律 RAG 系统的评估基准,评测检索准确性、引文验证能力、幻觉检测效果,对标 CaseFacts 和 PLAWBENCH 基准。
支撑司法辅助 AI 的事实验证模块,自动核查案件陈述与证据的一致性,辅助法官快速识别事实争议。
训练法律文书质量检测 AI,自动检查法律文书中的引文准确性、事实陈述一致性、证据链完整性。
本业务拆解文档基于 2026 年 7-8 月最前沿法律 AI 学术成果编制,对标 LexKairos(arXiv:2608.09106)、LegalGraphRAG(ACL 2026)、CaseFacts(ACL 2026)、PLAWBENCH(ACL 2026)等顶级研究。数据来源、规模、字段、授权范围、标注要求及交付方式以合规审核与书面项目约定为准。
长沙朗慧信息科技有限公司 · DataAssetsAPI · 2026年8月