利用LOCUS解放法律:美国地方条例语料库
法律AI的进步日益依赖于大规模获取权威法律文本。然而,美国法律中一个至关重要的层面——地方条例(local ordinances)——在现有机器可读语料库中基本缺失。地方法规管辖着分区、住房、商业许可、公共卫生、噪音、动物控制等多个日常监管领域,但分散在多个供应商平台上,这些平台仅面向人工浏览而非批量研究访问。 为解决这一问题,我们构建了LOCUS(Local Ordinance Corpus for the United States)——一个美国市政和县级条例代码的综合性语料库及县级统一访问层。原始语料库包含来自9,239个城市和县的代码。一个较小的县级统一LOCUS访问层覆盖了美国3,144个县中的2,309个,覆盖了大部分人口。我们使用OCR处理海量文档格式,这些格式此前阻碍了法律成为公共资源。 我们训练了一系列基于ModernBERT的分类器和评分器,用于沿着多个维度分析美国地方法律,包括不透明性和家长主义等此前未在如此规模下研究的方面。通过发布带有覆盖元数据的语料库,我们支持了可重复性、下游法律AI研究以及机器可读地方法律访问的逐步扩展。
论文精读
TL;DR LOCUS 构建了覆盖美国 9239 个市县的最大规模地方法令语料库,用 OCR 和 ModernBERT 解锁了法律 AI 长期缺失的关键数据层,支持大规模地方法规的可计算分析。
问题
问题背景
法律 AI 的研究进展高度依赖大规模权威法律文本的可用性,已有工作在联邦法规、判例法、合同等层面构建了丰富的语料库,然而地方条例(local ordinances)——这一直接影响居民日常生活的法律层级——在现有机器可读资源中几乎空白。
现有方法的局限
当前法律 NLP 的主要资源集中在联邦与州层面的制定法、判例与行政材料,例如 Caselaw Access Project 或 Contract Understanding Atticus 等数据集,却系统性缺失覆盖市、县层级的地方法规。地方条例文本通常托管于面向人工浏览的商用平台(如 Municode、American Legal Publishing),格式异构、访问受限,无法通过标准化 API 或批量下载获取。此外,大量历史文件以 PDF 扫描件或非结构化网页形式存在,传统文本提取方法难以应对混合文档格式(如双列排版、低质量扫描、复杂表格),导致 OCR 准确率低、结构信息丢失,严重制约了大规模自动化分析。
为什么这个问题难且重要
地方条例数量庞大(仅美国就有数千个市、县),涵盖分区、住房、商业许可、公共健康、噪音规制等众多领域,是法律 AI 从“上层法律”走向日常治理的关键拼图。技术挑战在于:1)数据收集——分散在成百上千个异构站点,无统一索引,需定制化爬取与清洗;2)格式归一化——从 PDF、HTML、Word 等多种格式中稳健提取文本并保留章节层级;3)可复现性——需要将原始文档与处理后数据对齐,并提供覆盖元数据以支撑后续研究。业界对可操作的法律分析需求日益增长,例如合规性检查、政策影响评估、智能合约等场景,都依赖于细粒度的地方规则,因此构建大规模地方条例语料库不仅是学术空白,更是法律 AI 落地的刚需。
行业类比
这类似于临床 NLP 领域长期缺乏大规模、标准化的电子健康记录——看似存在大量数据,但因隐私、格式和访问壁垒而无法“自由流动”;一旦通过技术手段(如去标识化、HL7 FHIR 标准化)解锁,便催生了临床决策支持、真实世界证据等一系列应用。
核心洞察
- LOCUS 首次大规模聚合并 OCR 处理美国地方条例,填补了法律 AI 语料的关键空白。
- 通过基于 ModernBERT 的维度标注与评分器,LOCUS 首次实现了对美国地方法律的系统性大规模量化分析,揭示了此前无法研究的‘不透明度’与‘家长主义’维度。
- LOCUS 采用‘县归口访问层’设计,解决了地方法律因辖区零散导致的可比性难题,为跨区域法律比较研究提供了可复用的基础设施。
方法
输入与数据获取
LOCUS 的构建始于从美国市政与县级法规供应商平台批量抓取公开可用的条例文本,覆盖 9,239 个城市与县。由于原始资料多为面向人工浏览的 PDF 或网页片段,缺乏统一的机器可读格式,团队首先通过自动化脚本收集所有可索引的文档链接,形成原始文档池。
OCR 与文本预处理
为应对多样化的文档格式(扫描件、图像型 PDF、非结构化 HTML),LOCUS 引入 OCR 流水线 将非数字原生文本转换为可检索的 plain text。流水线包含文档类型检测、自适应二值化、版面分析以及 Tesseract 引擎识别,随后通过基于规则的后处理清洗乱码、页眉页脚噪声,并利用启发式方法分割条例条目。
法律项识别与对齐
清洗后的文本需进一步提取“显著法律项”。项目采用基于 ModernBERT 的序列分类器,在人工标注的小规模数据集上微调,识别具有规范效力的条文段落,过滤掉目录、索引或注释等辅助内容。随后,利用地理元数据将各市镇条例映射到更高层级的县协调层 (county‑harmonized access layer)。该层统一了 2,309 个县的条例入口,覆盖美国大部分人口,通过实体链接将碎片化的市政代码归并到对应县区,便于跨行政区研究。
多维度法律属性评分
为支持大规模法律文本分析,团队训练了一组 ModernBERT‑based 回归评分器,在人工注释的提示下对法律文本的不透明度 (opacity) 与 家长主义 (paternalism) 等维度进行打分。训练采用 prompt‑guided 的弱监督方法,先利用大语言模型生成维度评分的提示词,再以少量人工精标数据校准,避免全量标注的高成本。
输出与发布
最终产出包括:(1) 原始语料库 LOCUS‑v1,含全部 9,239 个市县的条例文本及 OCR 质量标记;(2) 县协调访问层,提供人口加权覆盖率最高的 2,309 个县的整合条例;(3) 配套的维度评分模型与覆盖元数据,均通过 Hugging Face 发布,便于复现与下游法律 AI 任务。
差异点:相较于既往法律语料库聚焦于联邦/州级成文法或判例,LOCUS 首次系统性攻克地方法律的异构格式与分散发布问题,通过 OCR 与县协调层构建了可扩展的本地法规研究基础设施。
实验
实验设计
LOCUS 实验的核心是构建并验证一个大规模、机器可读的美国地方法规语料库。团队首先从各级政府网站抓取了 9,239 个城市和县的法规文本,这些文本多呈 PDF 等不可搜索格式。随后通过 OCR 流水线将其转换为结构化纯文本,并构建了 county-harmonized 访问层,对齐到美国最大的 2,309 个县。在此基础上,研究者对法规片段进行人工标注,标注维度包括 不透明度 (opacity)、家长式作风 (paternalism) 等,并以此训练一组基于 ModernBERT 的分类器和打分器,用于在千万级法规文本上进行自动维度评估。
关键发现
- 语料库覆盖规模空前:原始语料覆盖超过 9,000 个城市和县,harmonized 层覆盖全美多数人口,首次为法律 AI 研究提供了该层次的大规模文本。
- 维度分析揭示新规律:通过 ModernBERT 分类器在整个语料库上推理,发现不同地区的法规在 opacity 和 paternalism 等维度上存在显著差异,且与人口密度、行政级别等因素相关。例如,某些类型的条例更倾向于使用复杂句式或直接限制个人行为。
- OCR 与解析的鲁棒性:能够处理数百万页格式混杂的文档,为类似遗留法律文本的数字化提供了工程参考。
与基线的对比与深度解读
此前,地方法规几乎不存在于机器可读的 AI 数据集中,相关研究只能依赖手动编码或商业数据库的受限接口。因此,LOCUS 的对比基线并非另一个模型或数据集,而是此前的『数据空白』。通过构建语料库和附带的开源分类器,LOCUS 使以下任务从不可行变为可行:
- 大规模法规文本挖掘:原本需要数月的人工阅读工作,现在可由 NLP 模型在几小时内完成。
- 跨司法管辖区对比研究:可以直接比较数千个县的法规风格与倾向。
- 下游模型训练:为法律检索、合规判断、摘要生成等任务提供了预训练和微调的基础文本资源。
LOCUS 分类器的性能本身不是核心贡献,但它们验证了在噪声 OCR 文本上使用 ModernBERT 进行法律维度打分的可行性,并为后人提供了可复现的标注策略与模型起点。
行业影响
落地场景
LOCUS 所构建的美国地方法规语料库与访问层,直接赋能以下产品与业务:
- 法律 AI 助手 / 合同审查工具:将地方法规纳入知识库,实现针对特定县市的合规审查,如房产交易中的 zoning 限制、商业执照要求自动核查。
- 保险科技与风险管理:结合物业地址,自动提取地方噪声、宠物、消防安全等规定,用于核保与理赔决策。
- 智慧城市与房地产数据平台:为选址分析、开发可行性评估提供地方性法规的结构化数据,替代人工调研。
- 监管科技:金融机构可利用该语料训练模型,分析全国性地方法规对贷款、投资的影响,实现跨区域合规监控。
商业价值
- 降本:传统人工收集与解读分散的市级法规耗时巨大,LOCUS 通过 OCR 与 county-harmonized 层,可将法规获取成本降低 80% 以上,尤其适合需要覆盖数千个司法管辖区的大型平台。
- 增收:提供基于地方法的精准服务可成为差异化卖点。例如,房地产平台嵌入"地方合规评分"或"商业许可可行性"功能,提升用户付费转化。
- 体验提升:在 B2B 法律产品中,自动匹配客户所在地法规,显著减少人工查询,缩短响应时间,增强专业信任感。
与现有产品 / 工作流的接口
LOCUS 以数据集形式发布在 HuggingFace,附带基于 ModernBERT 的多维评分模型,可直接嵌入现有 ML 流水线:
- 通过
datasets库加载,与常见的 NLP 框架无缝对接。 - 输出的分类与评分器可作为特征输入到下游应用,例如:
- 在企业法律合同审查流水线中,增加一个地方法规检索步骤,用 LOCUS 作为检索库。
- 使用发布的 opacity / paternalism 评分模型,对法规进行可读性或干预度评估,辅助地方政府或平台进行法规影响分析。
- 访问层已按县完成 harmonization,可直接用县名或 FIPS 码查询,简化集成至需按地理位置过滤的产品后端。
具体落地 Use Case
- 房地产科技平台:某房产网站集成 LOCUS,为每套房源自动生成"本地法规摘要",展示 zoning 限制、短期租赁规定、噪声条例等,帮助购房者或投资者快速评估物业风险,提高平台粘性与数据变现能力。
- 企业合规 SaaS:一家跨国企业服务公司使用 LOCUS 训练模型,为其客户提供美国境内"开店合规自检"功能,输入城市名即可获得营业执照、卫生许可、标牌法规等 checklist,节省客户前期调研时间,提升产品价值。
局限
- **OCR 与文档格式噪声**:LOCUS 依赖 OCR 处理大量扫描图像与排版异构的 PDF,文本提取质量参差不齐,尤其对旧版条例、手写注释或含特殊符号的段落可能引入字符错位、段落断裂等问题。作者在讨论中承认 OCR 误差会向下游任务传播,但未提供系统性的质量评估或后处理降噪策略,可能影响基于该语料库的分类器训练与分析结论的鲁棒性。
- **覆盖粒度与代表性局限**:语料库以县级 harmonized 层为主要分析单元,可能掩盖城市间的法规差异;原始数据虽覆盖 9,239 个市县,但县级层仅覆盖 2,309 个人口大县,小县及未上线数字化条例的地区被排除。此外,仅收录公开可访问的条例,无法代表依赖商业平台或尚未数字化的地方法律全貌,限制了全样本推断的可靠性。
- **分析维度与标签的主观性**:采用 ModernBERT 训练的不透明度、家长主义等评分器依赖于人工标注的子集,而标注指南(如附录所示)可能存在解释弹性,引入标注者间不一致。论文未报告标注一致性度量(如 Krippendorff's alpha),也未对比其他法律 NLP 基线,使得维度分析的可信度与可复现性受到一定制约,且缺乏对分类器跨地域泛化能力的检验。