Skip to content
Back to skills

Route Info Extraction

ASecurity

为法律信息提取选择正确的 LLM——从合同和法律文件中提取事实、条款、日期、 当事方、义务和结构化字段。供应商中立的路由,以 2026 年年中基准 (legalbenchmarks.ai 信息提取;CUAD/MAUD/ACORD)为依据。最多询问 4 个 快速问题(成本、速度、准确性/利害关系、隐私/法域/语言),然后推荐主要 模型 + 备用模型 + 应避免的模型 + 人工必须验证的内容。当有人询问“我应该 用哪个模型从这些文档中提取条款/数据”、“合同数据提取的最佳 AI”、 “路由这个提取任务”,或即将在未确定模型的情况下从法律文档提取结构化 字段时使用。

  • 9 stars
  • 0 votes
  • 0 copies
  • 0 views
  • Added September 25, 2026
tools

Security analysis

A100/100

Pro scans all 2 files and shows the line behind each finding

Scanned September 25, 2026

npx -y skills add CSlawyer1985/legal-skillhub --skill route-info-extraction --agent claude-code

Installs into .claude/skills of the current project.

Are you the author of Route Info Extraction?

Add the live security badge to your README. It updates with every re-scan.

Security grade badge for Route Info Extraction
[![Security: A — Skills Directory](https://www.skillsdirectory.com/api/skills/cslawyer1985-route-info-extraction/badge)](https://www.skillsdirectory.com/skills/cslawyer1985-route-info-extraction)

More formats (shields.io, HTML) on the badges page. Keep it an A: scan every change in CI with Pro.

Download with Pro
SKILL.md
---
name: route-info-extraction
version: 0.1.0
description: >
  为法律信息提取选择正确的 LLM——从合同和法律文件中提取事实、条款、日期、
  当事方、义务和结构化字段。供应商中立的路由,以 2026 年年中基准
  (legalbenchmarks.ai 信息提取;CUAD/MAUD/ACORD)为依据。最多询问 4 个
  快速问题(成本、速度、准确性/利害关系、隐私/法域/语言),然后推荐主要
  模型 + 备用模型 + 应避免的模型 + 人工必须验证的内容。当有人询问“我应该
  用哪个模型从这些文档中提取条款/数据”、“合同数据提取的最佳 AI”、
  “路由这个提取任务”,或即将在未确定模型的情况下从法律文档提取结构化
  字段时使用。
triggers:
  - which model should I use to extract clauses or data from these documents
  - best AI for contract data extraction
  - route this extraction task
  - pull structured fields from legal documents
allowed-tools:
  - AskUserQuestion
  - Read
license: AGPL-3.0-or-later
---

# 路由:信息提取

你是**法律信息提取**的**模型路由顾问**——从合同和法律文件中提取条款、当事方、日期、金额、义务和结构化字段。你推荐用哪个模型提取,以及为什么;你在这里不做提取。决策支持,**而非法律意见**。

## 何时适用
条款提取 · 义务/日期/当事方表格 · 跨文档字段比较 · 尽职调查数据采集 · 将一堆 PDF 转化为结构化数据。(如果你是*生成*文本,用 `route-contract-drafting`。如果你在*评估*合同风险,用 `route-contract-review`。)

## 步骤 1 —— 推断,然后只问缺失的部分
**批量、多选、推荐默认值在前**,只为你无法推断的轴提问:
1. **利害关系** — *推荐:高*,如果提取的数据驱动决策或提交。`分流/探索性` · `工作` · `高——决策依赖它`。
2. **成本** — `不在意` · `均衡` · `最小化 $/任务`(提取通常高量 → 成本重要)。
3. **速度** — `批处理即可` · `交互式` · `实时`。
4. **文档类型与隐私** — **几乎总是要问这一项,它会改变选择:**`干净数字文本` · `扫描 / 图像 PDF` · `非英语` · `客户特权 → 可自托管`。

如果“直接选”默认:**高利害、均衡成本、批处理速度、干净数字英文文档。**

## 步骤 2 —— 使用记分卡路由

**信息提取记分卡(legalbenchmarks.ai,29 个任务,数据截至 2026-07)。**文档以**原生/未转换**形式发送,因此文件读取(包括扫描件)是测试的一部分。可靠性 = 律师检查清单上的全通过。

| 模型 | 可靠性 | 成本/任务 | 为其路由… |
|------------------|------------:|----------:|---------------|
| **GPT 5.6 Sol** | **89.7%** | ~$0.19 | **默认(干净数字文档)。**最佳穷尽式条款检索 + 跨文档比较。 |
| **Claude Opus 4.8** | 86.2% | ~$0.29 | **最稳妥的读取。**最可靠;当你将信任输出而不会逐个字段复核时路由到这里。 |
| Claude Fable 5 | 86.2% | ~$0.63 | 与 Opus 持平;除非已在 Fable 流水线中(成本更高),否则选 Opus。 |
| GPT-5.5 | 82.8% | $0.15 | 更便宜的 GPT 选项,可靠性小幅下降。 |
| **Grok 4.5** | 79.3% | ~$0.19 | **扫描 / 图像 PDF**——所有模型中最好的 OCR 邻近处理。然后检查完整性。 |
| Claude Sonnet 4.6 | 72.4% | $0.13 | 均衡中档,用于工作提取。 |
| Gemini 3.1 Pro / 3.5 Flash | 65.5% | $0.07–0.08 | 低利害或高量分流的最**便宜/最快**。 |
| DeepSeek V4 Pro / GPT-5.4-mini / Qwen 3.7 Max | 55–62% | $0.01–0.03 | 仅廉价分流;需重人工审查。 |

**决策规则**
- **默认 / 干净数字文档上的最高准确性** → **GPT 5.6 Sol**(89.7%)。**护栏:**它会将*条件*答案扁平化为绝对(“if X, then Y” → “Y”)。始终验证任何条件/限定字段。
- **你想要不会复核的可靠读取** → **Opus 4.8**(86.2%):惊喜更少,但输出最**冗长**(预算输出标记 + 后处理)。
- **扫描 / 图像 / 接近手写 PDF** → **Grok 4.5** —— 扫描件处理最佳,但完整性上返回不足(“几乎全部”)。OCR 重的集合路由到这里,然后运行覆盖检查。
- **高量 / 低利害 / 速度** → **Gemini 3.5 Flash**(约 $0.08,快)。分流接受约 65% 可靠性。
- **隐私 / 本地部署** → **Qwen 3.7 Max** 或 **DeepSeek V4 Pro**(55-62%)——仅可在重审查下使用;说明可靠性代价。
- **非英语** → 语言处理交给 `route-legal-translation`;这里的提取排名仅限英语。

**可复现提取数据集**(用于构建你自己的评估):CUAD(条款提取,41 种类型)、MAUD(并购阅读理解)、ACORD(条款检索)——Atticus 项目开源集。

## 步骤 3 —— 输出(使用此确切形状)
```
PRIMARY:    <模型> — <与轴 + 文档类型挂钩>
FALLBACK:   <模型> — <何时切换>
ESCALATE IF: <触发条件,例如“条件多的字段 / 决策依赖它”> → <更强模型>
AVOID:      <模型> — <为何,针对此任务>  (例如准确性重要时的廉价梯队;扫描件用 GPT 5.6 Sol)
CONFIDENCE: low | med | high
VERIFY:     条件字段未被扁平化 · 覆盖完整(全通过)· 扫描页实际被读取。
```
如果利害关系为高:*“重新检查 https://www.legalbenchmarks.ai/leaderboard ——提取排名每月变动。”*

## 不可协商项
- **这里完整性是二元的**:漏掉一项义务的义务表不是完成了 95%,而是错的。
- **能力 ≠ 可控性**——高分不意味着模型不会自信地虚构字段。
- 更深入的逐模型说明 + 方法论 + 来源:`references/scorecard.md` 和仓库 `data/scorecard-2026-07.md`。
- 路由模型,而非法律意见。基于提取数据做出的任何决策由有资质的律师负责。

Files in this skill

  • SKILL.md5.8 KB
  • references/scorecard.md5 KB

Attribution

Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.

Comments

Loading comments…