Models Agree 发布了一项关于 AI 判断者稳定性的实验性观察,使用 Reddit 的 r/AmIOverreacting 场景检验模型是否倾向于把复杂人际冲突判定为严重问题。当前可见信息仅来自文章标题与 Hacker News 条目,具体样本、提示词、模型和统计结果仍需查阅原文确认。
最近 24 小时暂无可用热度快照。