AI 在模拟视频问诊中挑战医生,结果令人震惊

一款基于 Gemini 的医疗 AI 将视觉、听觉与临床推理相结合,在模拟视频问诊的多项关键指标上达到或超越了医生水平,同时也揭示了人类连接与细微感知仍然重要的领域。

近期发表在 arXiv 预印本*服务器上的一项研究使用了 AMIE(一个基于 Gemini 的多智能体系统,集成了实时视听感知、低延迟对话和临床推理能力),展示了研究人员所称的专家级 AI 在模拟实时临床视频问诊中的表现。

AI 在模拟视频问诊中挑战医生,结果令人震惊
图片来自论文:https://arxiv.org/abs/2608.09861

视听临床 AI 的挑战与机遇

视频问诊是远程临床医疗的主流方式,使临床医生能够观察非语言线索、进行有限的体格检查,并建立医患关系。相比之下,大多数医疗 AI 的演示聚焦于即时通讯(IM)界面,这类界面擅长结构化推理,但无法捕捉实时患者互动的复杂性。

早期研究表明,将医疗 AI 扩展到视听模态是可行的,为更自然、更有效的远程医疗铺平了道路。然而,重大挑战依然存在,包括需要对视听线索进行准确、实时的感知,跨多样化患者表现的适应能力,无缝、低延迟的对话管理,以及复杂临床推理的整合。在这些领域实现临床医生水平的性能,仍是下一代 AI 临床智能体一个开放且关键的目标。

AMIE 的开发与临床应用评估

谷歌研究人员开发了 AMIE,一个用于实时视频临床问诊的多智能体系统,集成了三个专门化智能体:对话智能体(Talker Agent,用于快速、流畅的患者回应)、规划智能体(Planner Agent,用于管理临床目标)和感知智能体(Perception Agent,用于解读视听数据)。这些智能体基于 Gemini 3 Flash 和 3.1 Pro 构建,以异步方式协同工作,生成临床适宜的低延迟对话。

开发过程采用了自动化评估框架,包括定向单轮测试和模拟多轮对话,以评估端到端的临床和对话表现。评估分类法涵盖了与远程医疗相关的广泛临床视听线索和体格操作,根据虚拟可行性和患者演员的可执行性对线索进行区分。评估使用针对具体场景的评分量表和基于大语言模型(LLM)的自动评分器。

在临床评估方面,一项随机多臂客观结构化临床考试(OSCE)研究在 100 个模拟患者场景中,将 AMIE(视频和文本两种配置)与 10 名美国执业认证全科医生(PCP)进行了比较。问诊由 15 名专业标准化患者演员完成,由 20 名 PCP 临床评估专家组成的专家组使用通用和病例特异性评分量表进行评分。

评估标准包括诊断准确性、临床推理、治疗方案、沟通和感知敏锐度。来自患者演员和评估者的额外定性数据进一步评估了用户体验。

AMIE 在模拟实时视频场景中达到或超越全科医生

AMIE 在模拟实时视频问诊中表现优于或持平于全科医生。临床评估者认为 AMIE 视频版在所有五个病例特异性临床领域中均等于或优于全科医生,并给予其更高的总分:83% 对比 68%。

患者演员更倾向于 AMIE 视频版在评估和解释病情方面的表现,但在同理心和解决患者顾虑方面无显著差异。AMIE 视频版的诊断准确性更高,其首选鉴别诊断与预设参考诊断在 91% 的场景中吻合,而全科医生为 77%。当考虑前三位鉴别诊断时,这一差距缩小且不具有统计学显著性(98% 对 90%)。

AMIE 在临床推理方面也表现出色,得分 90% 对 76%;在治疗方案制定方面为 79% 对 67%。病史采集得分也高于全科医生,且其对实时视频的利用以及对患者辅助体格检查的指导明显强于全科医生。AMIE 在利用视频进行实时观察和指导检查方面尤为突出。沟通得分也倾向 AMIE,尽管患者演员在建立融洽关系和合作伙伴关系方面对全科医生有非显著性的偏好。

在比较视频和文本聊天界面时,患者演员对视频版在沟通效果、易用性和理解患者顾虑方面给出了显著更高的评价。视频版在感知和检查技能方面改善最为明显。两种模态的诊断和治疗表现相近,各个患者演员对智能体行为的评分也大体相似,但总体上更倾向视频版。

定性分析显示,视频问诊使症状的直接展示和同理心的一致表达成为可能,AMIE 被描述为全面且不急不躁。然而,全科医生在自然对话节奏方面更受青睐。AMIE 视频版也存在一些局限,包括偶尔遗漏视觉线索以及技术方面的挑战。

自动化评估表明,使用专门化智能体,尤其是感知智能体和规划智能体,大幅提升了 AMIE 的表现。完整系统在单轮和多轮临床场景中的整体表现均优于仅含对话智能体的版本,在视觉评估和临床推理方面表现突出。但在多轮自动化模拟中,视觉检查发现是通过口头舞台指示传达的,而非连续的实时视频。

尽管 AMIE 在大多数体格检查领域表现优异,但在细微感知任务上仍有困难,如检测眼球震颤、震颤或解读情绪状态。关键的是,异步智能体设计在提升自动化评估表现的同时,将平均轮次延迟从早期顺序架构的 21.4 秒降至 2.6 秒。

在每次实时问诊结束后,AMIE 和医生还完成了结构化的问诊后问卷,涵盖鉴别诊断和治疗方案。对于这一延迟限制较低的步骤,AMIE 使用多稿起草和综合策略来提升建议质量。

临床视频 AI 的下一步

AMIE 的异步多智能体方法展示了推进 AI 辅助临床视频问诊的巨大潜力。然而,局限依然存在,包括在精细解剖精度、情感细微差别和高频动作检测方面的挑战,以及对模拟患者而非真实临床场景的依赖。该系统还依赖离散的轮次交替,无法实现人类问诊中可能出现的自然重叠对话和视觉触发的插话。

此次比较也与典型视频问诊有所不同——全科医生被要求关闭摄像头以匹配 AMIE 缺乏视觉化身的设定,作者指出这可能影响了融洽感和同理心的评分。由于 AMIE 和医生的沟通风格及声音存在差异,完全盲法无法实现。

未来,研究人员应聚焦于解决这些局限,并在真实临床流程中进行广泛验证,以确保安全性和有效性。随着技术的成熟,AMIE 及类似系统有望扩大优质医疗的可及性,并增强远程医疗能力。

本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/jishu/71091.html

(0)

相关推荐