模型与实验室 3.0 · 值得看 2026-06-23 · 文章

四项新研究一致显示:LLM 医疗建议准确率低,不应作为临床决策依据

四项新研究一致显示:LLM 医疗建议准确率低,不应作为临床决策依据

打开原文回到归档

四项新研究一致显示:LLM 医疗建议准确率低,不应作为临床决策依据

Source: Gary Marcus | 2026-04-23 URL: https://garymarcus.substack.com/p/please-dont-trust-your-chatbot-for

注:原文抓取失败,此内容基于 RSS 摘要整理。

Summary (EN)

Gary Marcus compiles four new studies warning against LLM medical advice. BMJ: nearly 50% of chatbot responses on cancer/vaccines/nutrition had serious problems, delivered with high confidence. JAMA: 21 frontier models still unreliable on 29 clinical reasoning problems. Nature Medicine: non-expert users achieved <34.5% accuracy identifying diseases with LLMs, no better than control. The core problem isn't just model capability but users' inability to effectively guide models toward correct answers.

Summary (ZH)

Gary Marcus 汇总四项新研究,对「用 LLM 做医疗建议」发出严肃警告。BMJ 研究测试 Gemini、DeepSeek、Meta AI、ChatGPT、Grok 五款主流聊天机器人,近半数回答存在严重问题,且以高确信度表达。JAMA Network Open 测试 21 个前沿模型在 29 个临床推理问题上,结论是「当前 LLM 在早期诊断推理中仍有局限,不能依赖其进行无监督的患者-facing 临床决策」。Nature Medicine 研究发现普通人使用 LLM 疾病识别准确率不到 34.5%,不比对照组好。共同结论:问题不只是模型能力,也包括用户无法有效引导模型给出正确答案。