Hacker News 收录了一项关于“人类第一场考试”项目的观察:5 个前沿大语言模型被问及最喜欢的笑话时,给出了相同答案。现有摘要未披露模型名称、提问方式、笑话内容或重复实验结果,因此更适合作为关于模型偏好与训练共性的线索,而非确定结论。
最近 24 小时暂无可用热度快照。