← 返回 Token雷达 首页

通用模型竟然比医疗专用模型更懂医疗?一篇 ACL 论文的两个反直觉发现 | GAIR Paper 123

来源:雷锋网  ·  发布时间:2026-08-25  ·  热度:0 分

Doubao 、DeepSeek 在三语数据集上的表现,普遍超过 GPT-4o 和 Gemini。 作者丨幸丽娟 编辑丨岑 峰 医疗,是大模型落地最特殊的场景之一。特殊在哪里?特殊在一个很微小的错误,就可能导致致命的后果;也特殊在你不能用直觉去判断它"行"还是"不行"——你觉得医疗专用模型肯定比通用模型更懂医疗?直觉上是。但实验数据不支持。你觉得英语训练出来的模型处理英语医疗数据肯定最好?直觉上是。但实验数据也不支持。这两重"反直觉",正是纽约大学阿布扎比分校和阿布扎比克利夫兰诊所的研究团队在ACL 2026 Findings上发表的论文揭示的核心真相。论文链接:https://aclanthology.org/2026.findings-acl.573.pdf论文代码:https://github.com/congboma/MedErrBench研究团队构建了首个面向医疗错误检测、错误定

deepseek gpt gemini 大模型

阅读原文 →