所有评测
智能体评测法律工作
法律交付标准通过率
用 120 项真实法律工作测试智能体读取案件材料并制作法律交付物的能力,以全通过率和逐项标准通过率报告结果。
交付标准通过率%数值越高越好
评测要点
评测设置一览
01
正式任务
120 个
02
法律领域
24 类
03
公开示例
5 个
04
重复次数
1 次
05
单任务上限
200 轮
06
主指标
全通过率
评测方法与研究依据
先说明公开研究与任务背景,再解释当前榜单采用的统一口径、计分方式和适用边界。
学术与任务背景
学术与任务背景
任务由法律科技与执业专家围绕备忘录、合同审阅、披露清单等真实交付物设计,并以原子化实质标准逐项检查结果。
当前榜单记录采用统一材料、隔离环境和一致评分口径;正式任务不公开,公开示例只用于说明任务形态。
评测背景
评测背景
每项任务给出合伙人式指令与案件文档,要求智能体制作备忘录、披露清单、证词摘要、修订稿等完整法律成果,而非回答孤立法律问题。
正式结果来自横跨 24 个法律执业领域的 120 个私有任务;五个公开任务仅用于展示任务、资料与成果形态。
这项能力测什么
这项能力测什么
- 跨合同、协议、备忘录和证词材料进行法律分析
- 按精确文件名生成可用的专业法律交付物
- 逐项满足任务特定、原子化的实质性标准
当前榜单口径
当前榜单口径
- 每项任务在无网络的隔离 Linux 沙箱中运行,输入文档只读。
- 环境预装办公文档、PDF 与电子表格处理工具;支持视觉的模型可额外查看图片。
- 智能体获得任务说明、输入文件和精确交付文件名,不提供执行期间的实时反馈。
任务如何完成
任务如何完成
- 智能体把只读案件材料复制到工作区,读取并处理后在最多 200 轮内生成指定文件。
- 交付物必须使用任务指定的精确文件名;若某条标准声明的交付物全部缺失,该标准直接失败;若只缺少部分文件,其余内容仍参与评审,并将缺失文件标记为缺失。
- 从交付物中提取文本,与任务说明和每条匹配标准一起交给单一评审逐项判定。
如何计分
如何计分
- 每条标准等权且只能通过或失败,不提供部分分。
- 全通过率是所有标准均通过的任务比例;任一标准失败则该任务不计成功。
- 标准通过率是全部原子标准中通过项目的平均比例,用作更细粒度指标。
结果怎么解读
结果怎么解读
- 报告全通过率、标准通过率及其随发布日期的变化。
- 展示每任务成本、输出 token、估算时间与平均轮数。
- 公开示例展示输入材料、预期文件和模型交付物。
解读限制
解读限制
- 正式 120 项任务不公开,外部只能通过五个示例理解任务结构。
- 评分只读取交付物提取出的文本,视觉排版质量不会被完整捕捉。
- 精确文件名和全通过规则较严格,近似文件名或单项遗漏都会显著降低成绩。
示例任务
并购控制权变更分析
审阅收购数据室中的合同与内部备忘录,分析控制权变更和转让条款,并提交一份规定名称的综合交易团队报告。
成功条件
- 覆盖目标公司重要合同中的控制权变更与转让条款
- 结论可追溯到提供的合同和交易资料
- 生成并提交指定名称的 Word 报告