论文用语言学家新创、未曾存在过的中文歇后语,测试大语言模型的理解、解释与创作能力。结果显示,中文前沿模型在低频既有歇后语与新歇后语之间的准确率差距平均为23.6%,英语中心模型为5.1%;Gemini 3.1 Pro在新歇后语选择题上达到92.6%,但模型创作的歇后语评价明显低于人类。
最近 24 小时暂无可用热度快照。