阅读原文
Hacker Newsautomatic6131观点48

评测称:当前 AI 智能体尚不能开展开放式研究

原标题:AI Agents cannot currently conduct open-ended research

CruxEvals 发布一篇关于 AI 智能体研究能力的评测文章,核心结论是:现阶段智能体尚不能可靠完成开放式研究任务。Hacker News 页面仅显示该文章获得 1 分、1 条评论,尚缺少可核验的评测细节、数据集、模型范围与实验结果。

为什么值得读

开放式研究正是智能体产品最常宣称的能力边界,这篇评测的结论值得及时核对,但目前证据透明度不足。

标签

AI agentsresearch agentsevaluationsopen-ended researchagent reliability