论文围绕《红楼梦》构建中日双语数据集,含500个不同文化类别的片段,并系统评估基于大语言模型的机器翻译。研究指出三类问题:前沿模型对文化负载内容仍存在明显性能差距,评审者背景会造成较大判断分歧,常用自动指标也难以可靠衡量此类翻译质量。
最近 24 小时暂无可用热度快照。