模型排行榜替代不了的四项核验
「最适合法律工作的人工智能」表格回答的是工程师的问题。的黎波里的律师问得更窄:屏幕上的文本是不是原文、打不打得开、效力有没有证据。
两句话
- 我们不会在别人的题目上给某个模型加冕。
- 每个答复仍须过四关:来源打得开、身份对得上、效力证据看得见、是否适用仍由人决定。
隔几个月就会出现一张表。十个模型,几百道题,再加一个硬标题:这就是最适合法律工作的人工智能。
选引擎时这张表有用。写上诉状、核对利比亚民事期限时,它几乎是空的。
问错了
「最好的法律人工智能」没有法域。在哪套法律下最好、依据哪些来源、如果引文与模型所说不符由谁担责?
用英语写的跨境题目,对照美欧海湾法规打分,说明不了利比亚民商事诉讼法的某条、最高法院判决,或刊登修正案的官方公报期号。
第一:来源打得开吗?
打不开原文的引证只是装饰。在伊祖兰,引证是一扇门。打不开就不要依赖。
第二:身份对吗?
模型擅长概括,也擅长悄悄弄错:条号、年份、页码。句子仍好看,指针却指到别处。
第三:效力标记背后是什么?
现行、已修订、已废止、未确认。标记有用;若当成终局判断就危险。有时废止文本已链接,有时只被点名,有时只剩标记。证据等级不同。
第四:是否适用不是模型的工作
找到条文不等于它支配这起争议。那是律师的判断。
我们现在测什么——以及不宣称什么
我们测试已知文件能否从索引取回。那只能暴露缺记录,不能衡量意见质量。在没有由从业者标注的利比亚题库之前,我们不公布「法律正确率」。
| 模型排行榜显示的 | 提交文书需要的 |
|---|---|
| 一般任务的文笔 | 答复里打得开的原文 |
| 另一法域的准确度 | 法律、条文、页码的身份 |
| 速度与成本 | 与标记一并阅读的效力证据 |
| 包打天下的第一名 | 根据事实决定是否适用 |
世上最强的模型,若没有通往原文的门,仍只是一份流畅的草稿。