arXiv 预印本Gaurab Baral
LexFlip:揭示法律文本语义保持评测盲区的解离诊断基准
原标题:LexFlip: A Dissociation Diagnostic for Legal Meaning Preservation Metrics
论文75
简化后的法律条款所表达的意思是否仍与原文一致?当前通用的检验方法无法证实这一点:要求完全相同的句对得分最高、毫无关联的句对得分最低,使得词汇重叠度与法律效力同向绑定,因此任何关于词元重叠度的单调函数都能同时满足这两项要求。我们的解决之道是一种解耦设计——即在法律效力发生改变的同时保持表面形式不变的测试样本。我们发布了 LexFlip,它包含对魁北克法定法语的 373 处极小扰动,在反转法律效力的同时保留了 93%(0.93)的词元,并配备了一套用于评测评估指标、回归模型以及提示评判模型的测试框架。在我们测试的 7 种嵌入和 BERTScore 指标中,面对此类改动,其评分变化仅占“完全相同到毫无关联”全量程的 0.022 至 0.039;相比之下,双向自然语言推理(NLI)的这一比例达到了 0.670,而后者正是唯一会被“完全相同句对检验”所淘汰的类别。在 FrJudge 评测中,相较于测得的人类表现上限 r=0.597,仅凭一个纯长度特征的得分就超过了所有语义指标,并且具有我们所测得的最低差距。
为什么值得读
它用具体实验证明了主流语义相似度指标在严谨法律文本改写中的脆弱性,提醒从业者警惕基于嵌入的高分假象。
标签
Legal AINLPEvaluationBERTScoreNLIBenchmark