Hacker News 上出现了 WifeBench 项目,尝试用作者妻子的主观感受为大语言模型排序。页面和讨论摘要未披露模型清单、评测样本、评分标准或可复现实验结果;该条目发布时仅获 2 分、0 条评论。
最近 24 小时暂无可用热度快照。