这项研究将HealthBench对话的最终用户消息后半段删除,测试Claude Opus 4.8、GPT-5.5、Grok 4.3和Gemini 3.5 Flash在信息不足时是否会澄清、限定结论或避免过度承诺。四家模型评审的一致性仅中等(Fleiss κ=0.65),且存在同提供商偏差;在50题盲评中,LLM评审认可不确定性的比例为66%–84%,独立临床医生仅52%。
最近 24 小时暂无可用热度快照。