该研究构建 RepoComplianceBench,收集49个仓库的106个带有AI贡献规则的问题,测试四个前沿模型是否会读取并遵守禁用AI、披露使用、验证门槛和人工签核等要求。结果显示,代理几乎不会主动检索规则;提醒、规则摘录和验证反馈能改善披露与验证,但在AI禁用仓库中从未主动拒绝贡献。
最近 24 小时暂无可用热度快照。