Izuran LegalIzuran Legal
方法

模型排行榜替代不了的四项核验

「最适合法律工作的人工智能」表格回答的是工程师的问题。的黎波里的律师问得更窄:屏幕上的文本是不是原文、打不打得开、效力有没有证据。

2026年9月9日阅读 8 分钟Izuran Legal
Four checks

两句话

  • 我们不会在别人的题目上给某个模型加冕。
  • 每个答复仍须过四关:来源打得开、身份对得上、效力证据看得见、是否适用仍由人决定。

隔几个月就会出现一张表。十个模型,几百道题,再加一个硬标题:这就是最适合法律工作的人工智能。

选引擎时这张表有用。写上诉状、核对利比亚民事期限时,它几乎是空的。

问错了

「最好的法律人工智能」没有法域。在哪套法律下最好、依据哪些来源、如果引文与模型所说不符由谁担责?

用英语写的跨境题目,对照美欧海湾法规打分,说明不了利比亚民商事诉讼法的某条、最高法院判决,或刊登修正案的官方公报期号。

第一:来源打得开吗?

打不开原文的引证只是装饰。在伊祖兰,引证是一扇门。打不开就不要依赖。

第二:身份对吗?

模型擅长概括,也擅长悄悄弄错:条号、年份、页码。句子仍好看,指针却指到别处。

第三:效力标记背后是什么?

现行、已修订、已废止、未确认。标记有用;若当成终局判断就危险。有时废止文本已链接,有时只被点名,有时只剩标记。证据等级不同。

第四:是否适用不是模型的工作

找到条文不等于它支配这起争议。那是律师的判断。

我们现在测什么——以及不宣称什么

我们测试已知文件能否从索引取回。那只能暴露缺记录,不能衡量意见质量。在没有由从业者标注的利比亚题库之前,我们不公布「法律正确率」。

模型排行榜显示的提交文书需要的
一般任务的文笔答复里打得开的原文
另一法域的准确度法律、条文、页码的身份
速度与成本与标记一并阅读的效力证据
包打天下的第一名根据事实决定是否适用
世上最强的模型,若没有通往原文的门,仍只是一份流畅的草稿。
模型排行榜替代不了的四项核验 — Izuran Legal