Prov-GigaPath: 突破性全幻灯片基础模型推动数字病理学发展

RayRay
Prov-GigaPath数字病理学深度学习预训练模型医学图像分析Github开源项目

Prov-GigaPath: 数字病理学的革命性突破

数字病理学正处于一个激动人心的发展时期。随着生物医学数字化转型和生成式AI的迅猛发展,精准医疗的进展正在被大大加速。在这个背景下,微软研究院与普罗维登斯健康系统(Providence Health System)和华盛顿大学合作开发了Prov-GigaPath,这是一个基于真实世界数据训练的全幻灯片数字病理学基础模型,为该领域带来了革命性的突破。

数字病理学面临的挑战与机遇

数字病理学是精准医疗的重要前沿。在癌症护理中,全幻灯片成像技术已经成为常规,将显微镜下的肿瘤组织切片转化为高分辨率的数字图像。这些全幻灯片图像(Whole Slide Images, WSI)包含了解密肿瘤微环境的关键信息,对于精准免疫治疗至关重要。例如,通过分析淋巴细胞浸润情况,可以区分"热"肿瘤和"冷"肿瘤,从而指导治疗策略的制定。

然而,数字病理学也面临着独特的计算挑战。一张标准的千兆像素幻灯片在宽度和长度上都可能是典型自然图像的数千倍。传统的视觉Transformer模型难以处理如此巨大的输入,因为自注意力机制的计算复杂度会随输入长度急剧增加。因此,以往的数字病理学研究往往忽视了幻灯片中图像块之间的复杂相互依赖关系,从而错失了建模肿瘤微环境等关键应用所需的整体语境信息。

GigaPath: 创新架构实现全幻灯片建模

为了应对这一挑战,微软研究院团队开发了GigaPath,这是一种新型视觉Transformer,通过利用稀疏自注意力机制实现了全幻灯片建模,同时保持计算的可行性。

GigaPath模型架构概览

GigaPath模型架构概览

GigaPath采用了两阶段的课程学习方法:

  1. 图像块级预训练: 使用DINOv2自监督方法,结合对比损失和掩码重构损失来训练教师和学生视觉Transformer。

  2. 幻灯片级预训练: 采用基于LongNet的掩码自编码器进行预训练。

关键创新在于GigaPath对LongNet中稀疏自注意力机制的改进和适配。为了处理一张全幻灯片中大量图像块序列,GigaPath引入了一系列递增大小的分段,将图像块序列划分为给定大小的段。对于较大的段,引入稀疏注意力,稀疏度与段长成正比,从而抵消了二次增长。最大的段可以覆盖整个幻灯片,尽管采用了稀疏采样的自注意力。这使得模型能够系统地捕捉长程依赖关系,同时保持计算的可行性(与上下文长度呈线性关系)。

Prov-GigaPath: 首个基于大规模真实世界数据的全幻灯片基础模型

基于GigaPath架构,研究团队开发了Prov-GigaPath,这是首个在大规模真实世界数据上预训练的全幻灯片病理学基础模型。Prov-GigaPath在来自Providence健康系统的超过17万张全幻灯片中的10亿多个256×256像素的病理图像块上进行了预训练。所有计算都在Providence的私有租户内进行,并得到了Providence机构审查委员会(IRB)的批准。

Prov-GigaPath在标准癌症分类和病理组学任务以及视觉-语言任务上都达到了最先进的性能,展示了全幻灯片建模和大规模真实世界数据预训练的重要性,为推进患者护理和加速临床发现开辟了新的可能性。

Prov-GigaPath在癌症分类和病理组学任务中的出色表现

研究团队构建了一个数字病理学基准测试,包括9个癌症亚型分类任务和17个病理组学任务,使用了来自Providence和TCGA(癌症基因组图谱)的数据。凭借大规模预训练和全幻灯片建模的优势,Prov-GigaPath在26个任务中的25个上达到了最先进的性能,在18个任务中显著优于第二好的模型。

癌症亚型分类

在癌症亚型分类任务中,模型需要基于病理学幻灯片对癌症的细粒度亚型进行分类。例如,对于卵巢癌,模型需要区分六种亚型:透明细胞卵巢癌、子宫内膜样卵巢癌、高级别浆液性卵巢癌、低级别浆液性卵巢癌、黏液性卵巢癌和卵巢癌肉瘤。

Prov-GigaPath在全部9个任务中都达到了最先进的性能,在其中6个任务中显著优于第二好的模型。对于6种癌症类型(乳腺、肾脏、肝脏、脑、卵巢、中枢神经系统),Prov-GigaPath的AUROC(受试者工作特征曲线下面积)达到了90%或更高。这为癌症诊断和预后等精准医疗下游应用奠定了良好基础。

基因突变预测

在病理组学任务中,目标是仅基于幻灯片图像来判断肿瘤是否表现出特定的临床相关基因突变。这可能揭示出组织形态和遗传通路之间微妙的、人类观察难以捕捉的有意义联系。

除了少数几对已知的特定癌症类型和基因突变组合外,仅从幻灯片中能获取多少信号尚不清楚。此外,在一些实验中,研究团队考虑了泛癌症场景,试图在所有癌症类型和多样化的肿瘤形态中识别某个基因突变的普遍信号。

在如此具有挑战性的场景下,Prov-GigaPath再次在18个任务中的17个上达到了最先进的性能,在12个任务中显著优于第二好的模型。例如,在泛癌症5基因分析中,Prov-GigaPath在AUROC上超过最佳对比方法6.5%,在AUPRC(精确率-召回率曲线下面积)上超过18.7%。

研究团队还在TCGA数据上进行了直接比较,以评估Prov-GigaPath的泛化能力,发现Prov-GigaPath同样优于所有对比方法。考虑到对比方法都是在TCGA上预训练的,这一结果更加令人印象深刻。

Prov-GigaPath能够在全幻灯片层面提取与基因相关的泛癌症和亚型特异性形态特征,凸显了其学习的嵌入表示的生物学相关性,为未来围绕复杂肿瘤微环境生物学的研究方向开辟了新的道路。

Prov-GigaPath在视觉-语言任务中的潜力

研究团队通过整合病理报告,进一步展示了GigaPath在视觉-语言任务中的潜力。以往的病理学视觉-语言预训练工作往往集中在图像块级别的小图像上。相比之下,本研究探索了幻灯片级别的视觉-语言预训练。

通过在幻灯片-报告对上继续预训练,研究团队可以利用报告语义来对齐病理幻灯片表示,这可以用于下游预测任务,而无需监督微调(例如,零样本亚型分类)。具体而言,研究团队使用Prov-GigaPath作为全幻灯片图像编码器,使用PubMedBERT作为文本编码器,并使用幻灯片-报告对进行对比学习。

这比传统的视觉-语言预训练要具有挑战性得多,因为研究团队没有单个图像块和文本片段之间的细粒度对齐信息。尽管如此,Prov-GigaPath在标准视觉-语言任务(如零样本癌症亚型分类和基因突变预测)中仍然大大优于三个最先进的病理学视觉-语言模型,展示了Prov-GigaPath在全幻灯片视觉-语言建模中的潜力。

GigaPath: 迈向精准医疗多模态生成式AI的重要一步

研究团队进行了全面的消融研究,以建立全幻灯片预训练和视觉-语言建模的最佳实践。他们还观察到数字病理学中存在规模定律的早期迹象,即更大规模的预训练通常会改善下游性能,尽管由于计算限制,实验规模仍然有限。

展望未来,还有许多进步的机会:

  1. 尽管Prov-GigaPath相对于先前的最佳模型达到了最先进的性能,但在许多下游任务中仍有显著的增长空间。

  2. 虽然研究团队已经对病理学视觉-语言预训练进行了初步探索,但在追求多模态对话助手的潜力方面还有很长的路要走,特别是通过整合诸如LLaVA-Med等先进的多模态框架。

  3. 最重要的是,研究团队还没有探索GigaPath和全幻灯片预训练在许多关键精准医疗任务中的影响,如建模肿瘤微环境和预测治疗反应。

GigaPath反映了微软在推进精准医疗多模态生成式AI方面的更大承诺,在其他数字病理学研究合作中也取得了令人兴奋的进展,如Cyted、Volastra和Paige,以及其他技术进步,如BiomedCLIP、LLaVA-Rad、BiomedJourney、BiomedParse、MAIRA、Rad-DINO和Virchow。

结语

Prov-GigaPath作为首个基于大规模真实世界数据训练的全幻灯片数字病理学基础模型,为该领域带来了革命性的突破。它不仅在癌症分类、病理组学和视觉-语言任务上展现了卓越性能,更为精准医疗和临床发现开辟了新的可能性。随着技术的不断进步和更多数据的积累,我们有理由相信,基于AI的数字病理学将在未来的医疗实践中发挥越来越重要的作用,为患者带来更精准、更个性化的诊疗方案。

编辑推荐精选

讯飞智文

讯飞智文

一键生成PPT和Word,让学习生活更轻松

讯飞智文是一个利用 AI 技术的项目,能够帮助用户生成 PPT 以及各类文档。无论是商业领域的市场分析报告、年度目标制定,还是学生群体的职业生涯规划、实习避坑指南,亦或是活动策划、旅游攻略等内容,它都能提供支持,帮助用户精准表达,轻松呈现各种信息。

AI办公办公工具AI工具讯飞智文AI在线生成PPTAI撰写助手多语种文档生成AI自动配图热门
讯飞星火

讯飞星火

深度推理能力全新升级,全面对标OpenAI o1

科大讯飞的星火大模型,支持语言理解、知识问答和文本创作等多功能,适用于多种文件和业务场景,提升办公和日常生活的效率。讯飞星火是一个提供丰富智能服务的平台,涵盖科技资讯、图像创作、写作辅助、编程解答、科研文献解读等功能,能为不同需求的用户提供便捷高效的帮助,助力用户轻松获取信息、解决问题,满足多样化使用场景。

热门AI开发模型训练AI工具讯飞星火大模型智能问答内容创作多语种支持智慧生活
Spark-TTS

Spark-TTS

一种基于大语言模型的高效单流解耦语音令牌文本到语音合成模型

Spark-TTS 是一个基于 PyTorch 的开源文本到语音合成项目,由多个知名机构联合参与。该项目提供了高效的 LLM(大语言模型)驱动的语音合成方案,支持语音克隆和语音创建功能,可通过命令行界面(CLI)和 Web UI 两种方式使用。用户可以根据需求调整语音的性别、音高、速度等参数,生成高质量的语音。该项目适用于多种场景,如有声读物制作、智能语音助手开发等。

Trae

Trae

字节跳动发布的AI编程神器IDE

Trae是一种自适应的集成开发环境(IDE),通过自动化和多元协作改变开发流程。利用Trae,团队能够更快速、精确地编写和部署代码,从而提高编程效率和项目交付速度。Trae具备上下文感知和代码自动完成功能,是提升开发效率的理想工具。

AI工具TraeAI IDE协作生产力转型热门
咔片PPT

咔片PPT

AI助力,做PPT更简单!

咔片是一款轻量化在线演示设计工具,借助 AI 技术,实现从内容生成到智能设计的一站式 PPT 制作服务。支持多种文档格式导入生成 PPT,提供海量模板、智能美化、素材替换等功能,适用于销售、教师、学生等各类人群,能高效制作出高品质 PPT,满足不同场景演示需求。

讯飞绘文

讯飞绘文

选题、配图、成文,一站式创作,让内容运营更高效

讯飞绘文,一个AI集成平台,支持写作、选题、配图、排版和发布。高效生成适用于各类媒体的定制内容,加速品牌传播,提升内容营销效果。

热门AI辅助写作AI工具讯飞绘文内容运营AI创作个性化文章多平台分发AI助手
材料星

材料星

专业的AI公文写作平台,公文写作神器

AI 材料星,专业的 AI 公文写作辅助平台,为体制内工作人员提供高效的公文写作解决方案。拥有海量公文文库、9 大核心 AI 功能,支持 30 + 文稿类型生成,助力快速完成领导讲话、工作总结、述职报告等材料,提升办公效率,是体制打工人的得力写作神器。

openai-agents-python

openai-agents-python

OpenAI Agents SDK,助力开发者便捷使用 OpenAI 相关功能。

openai-agents-python 是 OpenAI 推出的一款强大 Python SDK,它为开发者提供了与 OpenAI 模型交互的高效工具,支持工具调用、结果处理、追踪等功能,涵盖多种应用场景,如研究助手、财务研究等,能显著提升开发效率,让开发者更轻松地利用 OpenAI 的技术优势。

Hunyuan3D-2

Hunyuan3D-2

高分辨率纹理 3D 资产生成

Hunyuan3D-2 是腾讯开发的用于 3D 资产生成的强大工具,支持从文本描述、单张图片或多视角图片生成 3D 模型,具备快速形状生成能力,可生成带纹理的高质量 3D 模型,适用于多个领域,为 3D 创作提供了高效解决方案。

3FS

3FS

一个具备存储、管理和客户端操作等多种功能的分布式文件系统相关项目。

3FS 是一个功能强大的分布式文件系统项目,涵盖了存储引擎、元数据管理、客户端工具等多个模块。它支持多种文件操作,如创建文件和目录、设置布局等,同时具备高效的事件循环、节点选择和协程池管理等特性。适用于需要大规模数据存储和管理的场景,能够提高系统的性能和可靠性,是分布式存储领域的优质解决方案。

下拉加载更多