【行客按】Med-Gemini模型是基于Gemini模型系列的高级AI工具,专门针对医学领域进行了优化。该模型整合了网络搜索功能,并可通过自定义编码器针对新型医疗内容进行调整。在14个医疗基准测试中,Med-Gemini在10个中达到或超越了行业最高标准,特别是在MedQA基准测试中,通过引入不确定性引导的搜索策略,实现了91.1%的高精度,较之前的Med-PaLM 2模型提升了4.6%。在实际应用中,Med-Gemini不仅在生成医学文本总结和转介信方面超越了人类专家,还在多模态医学对话和医学研究领域显示出巨大潜力。
Med-Gemini的核心技术及模拟验证
多模态模型
长文本处理能力
图 6: 皮肤科场景下与 Med-Gemini-M 1.5 进行假设性多模态诊断对话的示例
(a) 用户与我们的多模态模型 Med-Gemini-M 1.5 进行交互,模拟一位基于 SCIN (Ward et al., 2024) 病例的患者。SCIN 是一个外部数据集,未包含在微调混合物中。如果不进行大量额外的研究和开发,此系统并不适用于实际诊断任务。然而,本例通过继承自原始 Gemini 模型的对话能力与微调获得的新型多模态医学知识相结合,展示了未来丰富的多轮诊断对话的潜在可能性。在此交互中,Med-Gemini-M 1.5 在用户未提供图片时会要求上传图片(多模态信息获取),并能高效地得出正确诊断(开放式诊断),通过整合相关的视觉特征和其他收集到的患者症状来解释其推理过程(可解释性),回答有关治疗方案的问题,同时适当地将最终决定权留给专家。(b) 展示了从皮肤科医生那里收集的反馈,以定性评估诊断对话的内容,特别要求他们对模型的积极和消极方面进行评论。
