Methodology / 方法

可信度不靠
一个裸分数。

我们把案件、程序、事件、材料与可核查主张分开保存;让每条摘要回到证据,让每次合并可以被解释和撤销。

Coverage ledger / 覆盖账本

历史底库,不等于完整回溯

这些日期回答的是“本站从哪里开始”,不是“从此以后所有材料都已收齐”。

最早程序日期2015年8月17日

现有案卷中最早的正式程序锚点。

最早时间线事件2016年7月13日

现有结构化事件的最早日期。

历史底库首发2026年7月15日

首批精选案件首次公开,不代表完成历史穷尽采集。

线上采集起点2026 年 7 月 15 日
22:15:15

北京时间;此后默认读取最近 24 小时并按来源游标续采。

历史补采状态: 目标范围为每案自最早正式程序前 12 个月至今;当前仍在逐案补采,尚不代表该时间段的完整回溯。学术资料按争议点选择基础研究、近期研究与不同观点,不设统一年份下限。

机器可读覆盖信息同步发布于 /data/latest.json;实时成功时间与各来源游标更新时间见 /api/health

Data model

五层骨架,加一层争点地图

同一材料可以支持多个主张,但每个主张必须指出证据文档 ID。

01

Matter

用户看到的完整案件或监管事项。

02

Proceeding

具体案号、上诉或监管程序。

03

Event

起诉、动议、裁判、和解等时间线节点。

04

Document

官方文书、报道、评论或论文的元数据与深链。

05

Claim

指控、程序事实、事实认定、裁判结论或预测。

MatterIssue × IssueDocumentLink

争议点把双方观点、法院处理和仍未解决之处放在一起;论文、评论与背景报道只通过争点链接进入案卷,不需要伪造一个“发表”程序事件。

Selection

什么案件会公开

必须已有正式法律行动,达到 60 分才可自动建立公开案件页。

30法律新颖性
25影响范围
20机构层级
10跨境性
15持续独立报道
公开门槛

新案件必须有正式案号或监管编号,并有一手材料,或两个真正独立的 B 级以上来源。未达到门槛的线索进入隔离队列,不用低置信度内容填充网站。

Source scoring

信源评分:五项证据

方法参考 Journalism Trust Initiative 与 Trust Project 的透明度、编辑流程和更正原则。

25可追溯性
20编辑与更正机制
20作者 / 所有权透明
20专业能力
15历史准确性
A85–100

高度可追溯

B70–84

可靠且可核验

C50–69

需要额外核验

D低于 50

不作为自动发布依据

U未评级

证据不足

参考:Journalism Trust InitiativeThe Trust Project

来源属性

一手 / 二手

法院文书是一手材料,但投诉状只证明“有人提出指控”,不证明指控为真。

利益关系

独立 / 当事方 / 代理方

机构可靠性与其在具体案件中的立场是两个不同维度。

主张状态

确认 / 支持 / 单方 / 争议

论文 DOI 可证明论文存在,不能据此改变案件的程序状态。

Deduplication

去重,但不抹掉差异

精确合并

稳定标识符相同

DOI、案号、ECLI、CELEX、监管编号、规范 URL、RSS GUID 或文件哈希相同,直接归并记录。

文档家族

转载只算一个来源

标题相似度至少 95%,且 MinHash Jaccard 至少 0.92,归入同一 DocumentFamily。

事件归组

同案、同类、48 小时

还须共享官方文书,或共享当事方且标题相似度至少 90%。

绝不只凭名称自动并案

平行诉讼、上诉程序与合并审理只建立关系。所有合并记录证据、算法版本与反向拆分信息。

Daily pipeline

两条支线,一道发布门

CASE FACT LANE / 案件事实线

可以新增程序事件

官方文书与明确描述直接案件进展的报道进入匹配、聚类和状态校验。“判决、驳回、撤销、改判”仍只能由现行官方材料触发。

ISSUE KNOWLEDGE LANE / 争点知识线

只能关联既有争议点

论文、专业评论、技术报告和背景新闻可以帮助理解问题,但不能创建程序时间线节点、改变案件阶段或生成裁决描述。

  1. 01增量采集

    只使用允许的 RSS/API 与元数据端点。

  2. 02规范与去重

    清理 URL、标识符和转载家族。

  3. 03分流与匹配

    先判定事实线或知识线,模糊候选留在隔离队列。

  4. 04分类与摘要

    摘要逐事实返回 Document ID。

  5. 05门槛校验

    日期、数字、案号与实体必须通过。

  6. 06原子发布

    同批页面、索引、JSON 一起上线。

模型的权限边界

Cloudflare Workers AI 的 Qwen3 模型只生成结构化中文摘要,温度为 0;模型不能决定案件合并或裁决效力。校验失败会重试一次,之后使用确定性模板或暂缓发布。每日内部预算上限为 7,500 Neurons,耗尽后顺延,不产生付费。

状态词的权限边界

“判决、驳回、撤销、改判”等状态只能由现行官方文书触发。当事方声明与媒体报道只能产生带归因的主张,不会单独改写案卷状态。

学术挂接的权限边界

论文必须具有 DOI、OpenAlex ID、SSRN ID 或稳定机构仓储标识,并具备完整题名、作者、日期和真实出版机构。确定性规则先命中既有争议点,模型只能在这些争议点中选择,相关度不得低于 0.80。Crossref 与 OpenAlex 只作为发现渠道,前台显示真实期刊、出版社或研究机构。

Collection limits

我们保存什么、不保存什么

仅保存标题、作者、来源、日期、稳定标识符、原创短摘要、链接与必要定位信息。临时抓取文本只在单次任务中处理,结束即删除。

本站不镜像新闻、论文、法条或裁判全文,不绕过付费墙。所有第三方材料均使用深链;原站更正或撤下时,本站同步标记。

检索全部案卷

搜索案件页、争议点和已登记的研究题名;结果会在当前输入框下方更新。

输入两个以上字符开始搜索。