论文测试 Claude Opus-4.7、GPT-5.4 和 Gemini-3.1-Pro 在未提供医学图像、仅给出人口统计描述时的回答。三者均可能生成诊断,且结果随种族、性别、年龄系统性变化;研究还发现结构化诊断字段可能在文字承认缺图时仍填写疾病,并存在对提示词的敏感性。
最近 24 小时暂无可用热度快照。