数据分析医疗行业,临床与运营数据分析
2023年,我接手了一个颇为棘手的项目:华东某地级市三级综合医院,开放床位1200张,年出院患者约6.2万人次,年收入约9亿元。这家医院的信息化底子并不差,HIS、LIS、EMR、病案首页系统一应俱全,数据中心机房建成已满两年。但当我在院长办公会上问出三个问题时:哪些病种正在实际亏损?哪些科室的耗材用量显著高于同区域同级医院?为什么ICU患者平均住院日比外科系统高60%?院长、信息科主任和运营助理面面相觑,没有一个人在会上给出答案。
这个场景在我过去六年的医疗数据咨询工作中反复出现。医院最不缺的就是数据:每天的挂号记录、医嘱明细、检验结果、手术麻醉记录、费用流水,以GB为单位的增量从各个系统涌出,但绝大多数数据进入服务器后就再也没被读取过。今天我要讨论的问题,不是大数据、人工智能或大模型如何赋能医疗,而是更根本的:当一家医院连“哪个病种在亏钱”“哪个科室的效率在恶化”这样的基础问题都无法用数据回答时,临床与运营数据分析应该从哪里真正切入。
这篇文章不讲普通的技术概念,只讲我实际调研、设计、实施和复盘过的经验。
我参与过十余家医疗机构的临床与运营数据体系搭建,得到一个反直觉的判断:医疗行业最稀缺的并不是数据分析师,而是懂得临床逻辑、医保规则和运营管理三者之间如何互译的“翻译官”。算法工程师在电商、金融领域颇为顺手的模型,放到医院往往举步维艰。问题不在算法,而在数据定义和业务解释。
举例来说,一位临床医生眼里的“脑梗死患者”,关注的是NIHSS评分、溶栓时间窗、血管再通情况;一位医保办负责人眼里的同一名患者,关注的是DRG入组是否准确、病组权重是多少、实际费用是否超支;一位运营管理者眼里的同一名患者,关注的则是平均住院日是否挤占了床位周转、护理人力配置是否匹配。同一个病人、同一次住院治疗、同一套费用流水,因为观察角色不同,需要的数据形态完全不同。这就是我所说的“翻译断层”。
在一家信息化基础尚可的医院里,检验检查结果电子化率几乎都能达到99%,病案首页电子化率达到98%。管理层通常以为“信息化程度高就等于数据可用”,实际情况却大相径庭。在大部分医院,真正进入数据分析管线、被二次计算或关联挖掘的数据,占比可能不到全院数据总量的5%。诊断信息在HIS里是一套编码,在EMR里是一段自由文本,在病案首页里又是另一套ICD编码,三重不一致导致:想分析“某一疾病患者的费用结构”,首先得花两周时间去确认到底以哪套数据为准。
-- 示例:脑梗死患者费用结构分析中常见的字段映射问题 SELECT a.住院号, a.主要诊断 AS 病案首页诊断, b.诊断名称 AS EMR诊断描述, c.结算费用类别 AS HIS费用类别 FROM 病案首页 a LEFT JOIN 电子病历诊断表 b ON a.住院号 = b.住院号 LEFT JOIN 住院费用明细 c ON a.住院号 = c.住院号 WHERE a.出院日期 >= '2024-01-01' AND a.主要诊断 LIKE 'I63%' -- 病案首页用ICD-10编码 LIMIT 50;
上面这段简单的SQL逻辑,在真实医院环境里执行起来很麻烦:EMR诊断表是自由文本,HIS费用类别是收费项目分类,病案首页是医保编码。三者之间没有统一的诊疗主键。这也是为什么许多医院建了数据仓库之后,业务科室依旧觉得“还不如找信息科人工拉数”。
综合我实际经历过的项目,临床与运营数据分析在当下的医院环境里,最快的破局点不是建数据中台,也不做机器学习预测,而是把DRG/DIP医保结算数据拉通,做“医保盈亏归因”。原因有三个:第一,医保支付改革是刚性的,任何院长都无法回避,最终医保实际结算金额是医院现金流的直接来源;第二,DRG分组和结算结果本身高度结构化、可量化,数据基础相对最扎实;第三,盈亏归因能把临床诊疗行为、病案编码质量和医院成本结构三个曾被割裂的维度拉进同一个分析框架。
有些医疗机构一上来就做“全院经营驾驶舱”“实时运营监控大屏”,这是典型的资源错配。大屏解决的是“看得到”,不能解决“看得懂”。如果医院的核心决策者无法通过数据回答“我们到底在哪类病种上亏损、哪类科室是成本黑洞”这两个问题,屏幕再炫丽也没有管理价值。这是我给同行和医院管理者的第一个专业判断。

我在医院调研时,最喜欢做的一件事就是跟着运营助理和信息科数据组的人走完一次“从业务问题到数据结果”的全流程。这个过程往往让人沮丧,但也最能看到真实的问题所在。
某医院信息科下设一个3人的数据组,每天上午雷打不动有两件事:第一件,登录HIS后台导出昨天的住院收入日报,在Excel里做透视表,整理成固定格式后发到院长微信群;第二件,查收各职能科室发来的数据申请邮件,按优先级手工排队。整个数据组的技术栈几乎停留在“SQL取数+Excel整理”阶段,偶尔用Python清洗一下绩效考核需要的数据,但从未形成真正的分析能力。他们最大的工作量不是分析,而是手工处理报表,平均每天3到4个小时消耗在重复劳动上。
这家医院的质控科主任一直想分析“非计划重返手术室”的原因。她向信息科提了申请,第3周才拿到数据,而且拿到的是最原始的平面表:只有患者ID、手术时间、再次手术时间、住院号。她真正需要的关键变量,首次手术的级别、麻醉分级、术前抗菌药物使用时机、主刀医生职称,全部缺失。质控科又花了两个月去病案室翻病历,最后这项分析不了了之。这暴露的是数据建模前置设计的缺失,不是取数速度的问题。
这家医院的运营助理每月要花一周多时间做院长运营汇报PPT,一共77页。每页都是一张趋势图或柱状图:门诊量、住院人次、药占比、耗占比、平均住院日、床位周转次数。但当院长问“为什么本月药占比环比上升了1.2个百分点”时,PPT里没有答案。运营部的同事随后去找信息科拉数据,重新花了三天做关联分析,依然只能停留在“药品收入增长主要是抗菌药物和肿瘤辅助用药”这样的笼统判断上,无法定位到具体科室、具体病种、具体医生。
这就是典型的“有量无数、有数无据”。
呼吸内科主任想知道自己科室在同类医院中的药占比和平均住院日水平,但医院层面没有任何部门能提供同区域同级医院的基准数据。她想用病案首页数据做单病种质控分析,发现病案首页的诊断编码在入院记录、病程记录和医保结算单上经常不一样,她只好让自己的研究生手工核对。临床科室的数据分析需求其实很旺盛,但医院的公共数据服务能力完全跟不上。

拆解完场景之后,我在十余家医院的项目复盘里总结出五个最高频的错误操作,每一个都让医疗机构付出了真金白银的代价。
很多医院花了数百万建运营指挥中心,核心诉求是“领导来了有东西可以展示”。但大屏上的数据通常只能反映昨日全院收入、在院人数、当日手术量这类指标。这些指标呈现现状,却不能回答“为什么”。我见过一家医院数据大屏上显示着当日门诊预约人数与去年同期对比的柱状图,然而当院领导追问“预约减少的原因是什么”时,操作员只能切换回后台Excel。大屏本身是最后的呈现层,如果前面的数据管道、业务口径、分析逻辑没有建好,大屏就是一块昂贵的电子横幅。
某医院信息科骄傲地向我展示他们的BI平台里配置了800多个指标,覆盖医疗质量、运营效率、财务状况、科研教学等全部板块。我请院长自己登录系统回答三个问题:本月医保预结算差额是多少?哪个DRG病组的亏损金额最大?外科系统各科室的平均术前等待时间是几天?结果院长和坐在旁边的信息科副主任搜索了15分钟,也没能在800多个指标里快速定位到这三个问题的答案。指标不是越多越好,关键是能否直接回答核心决策问题。
院长真正高频使用的指标,一般不会超过12个。
许多医院的数据平台建设由信息科牵头,选型时主要看服务器性能、数据库架构、并发能力等技术指标。上线之后才发现,业务部门根本不用。原因很简单:数据分析项目本质上是一个组织变革项目,不是软件部署项目。如果财务科不参与成本口径的定义,质控科不参与质量指标的筛选,医务科不参与临床路径的分析设计,这套系统建出来也只是一个能运行但没人认账的空壳系统。在我参与的项目中,凡是业务科室参与深度不足的项目,一年内活跃使用率普遍低于20%。
病案首页的主要诊断编码准确率,是医疗数据分析工作中最关键、也最常被忽视的基础指标。国家医保局关于病案首页的相关质量要求明确,主要诊断选择及编码准确率是DRG/DIP付费的基础。而我在多家医院的抽样结果并不理想:以脑梗死为主要诊断的病例中,约30%的首页没有填写到准确的I63.x细分编码,而是笼统填写I63.900。在这样一种数据质量水平下,任何基于病种费用、病种成本、DRG盈亏的分析,结论都会被严重扭曲。分析做得越精细,误导反而越大。
我对任何医疗机构说“我们要在12个月内建成全院级数据中台”的规划都不太赞成。原因在于:医院各信息系统之间的数据标准差异极大,业务主数据年年在变,医保DRG/DIP分组规则每年调整,临床路径和收费项目的对应关系极其复杂。这种大而全的项目大概率在第一年陷入数据治理的无底洞,第二年因为看不到业务价值而被边缘化。更务实的路径是从一个明确的业务问题出发,只拉通与此问题相关的数据集,在4个月之内交付可量化结果,借此建立信任,再逐步扩展数据资产的范围。

经过了这么多踩坑之后,我沉淀出一套判断一家医院是否准备好做数据分析、以及应该从何处开刀的决策逻辑。
我的选型方法非常简单:把医院当前面临的业务问题放进一个坐标轴,横轴是“若解决该问题,每年可能带动的金额影响”,纵轴是“该问题在现有数据条件下解决的难度”。原则上优先选择那些难度中等、影响金额较大的问题,而不是影响最大但数据基础极差的问题。下面用一个表格说明典型的备选方向。
| 分析主题 | 估计年化金额影响 | 数据基础成熟度 | 建议优先级 |
|---|---|---|---|
| DRG/DIP医保结算盈亏归因 | 数百万元级别 | 较高(DRG分组结果与结算记录明确) | 第一优先 |
| 病种成本精确核算 | 数百万元级别 | 较低(需要打通成本动因和收费明细) | 第二优先 |
| 临床路径偏离分析 | 百万元级别 | 中等(EMR中路径节点记录尚可) | 第二优先 |
| 门诊流量与预约转化分析 | 百万元级别 | 中等(预约系统和HIS数据可关联) | 第三优先 |
| 单病种质量指标监测 | 间接影响 | 较高(国家单病种质控平台已有标准) | 第三优先 |
需要注意的是,这个优先级排序只适用于当前医保支付改革压力大的地区。如果医院位于自费医疗占主导的高端民营医院,排序会完全不同,彼时更重要的可能是患者全生命周期价值分析和获客渠道效果分析。
在经历了指标爆炸的项目之后,我把医疗数据分析的指标体系收敛为“两层结构”:第一层是院级决策指标,控制在12个以内,主要包括医疗服务量、手术占比、四级手术占比、平均住院日、药占比、耗占比、每床日收费、医保结算差额、病案编码准确率、非计划重返率、患者满意度、人员费用占比;第二层是科室级运营指标,每个科室控制在20个以内,由科室主任与运营分析师共同定义。这样做的优点是:院长一眼能看到全院最核心的12个数字是否健康;
科室主任能在自己的范围内看到可采取行动的具体原因指标。两层指标用同一个口径和同一套数据源构建,避免了过去“院级一套数、科室另一套数”的尴尬。
一家医院想真正拥有数据分析能力,不需要立刻扩充一支几十人的团队。我推荐的起步配置是3个人:一位临床数据分析师,通常来自临床科室或护理背景,熟悉诊疗流程和EMR数据;一位数据工程师,隶属于信息科,熟悉HIS、LIS等系统表结构,能够高效完成数据抽数和清洗;一位运营分析师,来自财务部或运营管理部,熟悉科室核算、绩效方案和医保结算。这三人组成一个虚拟的数据分析办公室,直接向分管副院长汇报。
关键成功要素有三个:第一,这个虚拟团队要有明确的月度优先级,不是各科室的“取数苦力”;第二,运营分析师必须具备把数据结论翻译成管理动作的能力;第三,医院要给这个小组授权,让他们能直接进入各业务系统取数。
我对工具的态度是:能用Excel解决的问题,不要引入新系统;能用报表工具解决的问题,不要上数据中台。具体建议是:如果医院目前的分析任务主要是固定报表和手工Excel处理,那么首先考虑在现有BI工具或报表系统里优化口径配置,而不是新增平台。只有当医院开始需要回答“医生A和医生B在同类病种上的费用构成差异为什么这么大”这样的开放性问题时,才适合引入自助式分析工具或云上数据仓库。
这里有一个重要提醒:我在不止一家医院看到购买了功能强大的商业智能平台,但使用率极低,原因是平台上线后缺乏专职人员配置,最终沦为信息科展示型大屏的附属品。

为了把上面的判断逻辑说得更具体,我分享一个相对完整的案例。为保护医院隐私,相关数据已经做脱敏处理,但关键变化过程完全来自实际项目实施经验。
该院为华东地区一家地级市三级综合医院,开放床位约1200张,年出院患者6.2万人次。项目启动前,我们通过一个月的调研确认了四个核心痛点:病案首页主要诊断编码准确率约64%,导致DRG入组率只有91%;平均住院日8.4天,在同级别医院中处于劣势;2022年医保结算差额为负数,亏损金额接近1000万元;全院没有一套统一的病种成本核算方法,财务科的成本报表与运营管理部的绩效数据经常对不上。
我坚持把项目切分为四个阶段,每个阶段都有明确的交付物和验收标准。
项目结束后的6个月观察期内,各项指标发生了比较明显的变化:主要诊断编码准确率在第四周开始出现第一个明显跳升,从64%提升到71%,主要原因是病案室增加了每日复核机制;到第十八周达到89%,三个月后进一步稳定在92%左右。DRG入组率从91%提升到98%,入组质量改善直接带动了医保结算差额的改善。平均住院日从8.4天逐步下降到7.2天,下降幅度中大约一半来自择期手术患者术前等待时间的压缩,另一半来自床旁康复和临床营养干预的早期介入。
-- 示例:医院DRG盈亏归因分析的核心查询逻辑(已脱敏) SELECT 科主任, DRG分组代码, COUNT(*) AS 病例数, SUM(医院总费用) AS 实际总费用, SUM(医保核定拨付额) AS 医保拨付合计, SUM(自费及其他补偿) AS 患者自付部分, SUM(医保核定拨付额 + 自费及其他补偿 - 医院总费用) AS 结余金额 FROM 病案首页_DRG结算汇总 WHERE 出院月份 BETWEEN '2024-01' AND '2024-06' GROUP BY 科主任, DRG分组代码 HAVING COUNT(*) >= 5 ORDER BY 结余金额 ASC LIMIT 30;
这段SQL正是当时为医院写的“DRG亏损TOP 30病组”查询逻辑的一部分。它的价值在于把病种、科室、医保结算、费用结构四个维度一次性串了起来,让质控科和财务科第一次能够高效地对同一批病例进行会诊式讨论。
整个项目的最终产物并不是一套昂贵的软件,而是一套“业务规则+分析模型+月例会制度”的组合。医保结算差额从2022年的亏损约980万元,改善为2023年下半年的盈余约140万元;虽然其中有一部分是医保支付标准调整带来的红利,但病案编码准确率提升带来的入组高靠和费用结构优化带来的超支减少,是项目团队验证过的主要驱动力。更关键的是,院长开始养成在运营数据专题会上用数据盘问科主任的习惯,“平均住院日为什么高于同行”“四级手术占比为什么连续两个月下降”这类问题成为常态。
当分析文化开始形成,具体某一套系统反而不再重要了。


不同级别、不同属性的医院,在现有条件和约束下,适合的切入路径应该有所侧重。我给三类机构提供三条差异化行动路线,并用评判框架说明各自的取舍。
三级医院的典型优势是病种结构复杂、手术量大、DRG入组病组多,因此最适合做深层次的病种成本分析和外科运行效率分析。具体行动建议如下:第一,组建由财务科牵头、信息科和病案室配合的成本核算小组,用作业成本法重新梳理10个重点病种的费用结构,找出与DRG支付标准之间的差额;第二,分析外科系统的术前等待时间分布,建立“入院后48小时内完成必要检查”的标准化流程,直接压缩平均住院日;
第三,把四级手术占比、微创手术占比纳入科室绩效月度复盘,让“高难度手术”和“资源使用效率”两个目标清晰可见。三级医院做这件事的最大风险是组织协调成本高,所以建议周期控制在6个月以内,并且一定要由院级领导直接挂帅。
二级医院的数据基础和人才储备通常弱于三级医院,不适合一上来就做复杂的成本核算。我建议从医保结算数据出发,先把自己医院DRG病组的盈亏账算清楚。二级医院往往病种以常见病、多发病为主,入组病组相对集中,数据量不大,用Excel甚至Python都能完成归因分析。具体行动建议:第一,每月从医保结算系统导出DRG分组结果和结算明细,建立一张“病组盈亏总表”,列出每个病组的病例数、平均费用、医保拨付金额、患者自付部分、盈亏额;
第二,挑选收入排名前十的病种,逐一核对病案首页的主要诊断编码和手术操作编码是否准确;第三,与同级医院进行单病种质量指标对标,优先选择国家单病种质量管理平台已经覆盖的病种,例如急性心肌梗死、社区获得性肺炎,避免自己从头设计指标。
民营医疗集团的最大特点是多院区分布、信息系统相对标准化程度略强,而且集团总部对医院的经营绩效有较强的掌控力。这样的机构应当优先建立跨院区的标准化指标库,实现“同一指标、不同院区”的横向对比。具体行动建议:第一,集团层面定义统一的“每床日收入”“每门诊人次费用”“人员费用占医疗收入比”等指标,并让各院区按要求报送标准化数据;第二,重点分析不同院区之间同病种的成本差异和临床路径执行差异,寻找可推广的最佳实践;
第三,建设患者全生命周期数据视图,把门诊、住院、术后随访、二次就诊串联起来,为会员运营和诊所扩张选址提供决策依据。集团化医疗机构的优势在于可以在多个院区间做A/B测试,比如在A院区推行新的日间手术流程,在B院区保持原有流程,四周后用数据对比效果。

数据分析项目推进过程中,最消耗管理精力的不是技术问题,而是一系列两难取舍。
最理想的状态当然是既能追踪每一位患者从症状到诊断到治疗到转归的全路径,又能把每一个诊疗环节的成本追溯到具体资源消耗。但在现实医院里,这样的数据完备程度几乎不存在。在项目实践中,我建议遵循“关键节点精确、非关键节点从简”的原则:把精力放在诊断编码、手术级别、用药时间节点、费用累计等对结果影响最大的变量上,不需要执着于采集全流程的每一个事件。过度追求精细必然导致数据治理成本失控。
临床与运营数据分析必然涉及大量患者个人健康信息和诊疗数据。我的原则很明确:凡是可以基于匿名化和聚合数据进行的管理分析,就不要使用个案级原始数据;凡是必须使用个案数据的质量改进项目,一律要求脱敏处理并严格限制访问权限。在做DRG盈亏归因时,使用的是病案首页和费用结算数据,需要在内部数据安全制度中明确数据使用范围。在项目交付阶段,给医院提供的报表模板也应该去掉患者姓名、身份证号等直接标识符,只保留病案号、住院号等内部唯一标识。
很多医院管理者期望三个月看到成果,这完全可以理解。但数据和AI能力的建设本质上是一个长周期事件。我的折中策略是“以短养长”:每个月都交付一个能直接解决当前业务痛点的快速成果,例如“本月医保拒付原因分析”“上月非计划重返率专项报告”,这些短期成果换来管理层和业务科室的信任与持续投入;与此同时,默默推进指标口径、主数据字典、成本动因模型等长期能力的建设。没有长期能力建设,短期成果无法固化;没有短期成果支撑,长期建设无法生存。
医院如果完全自建数据团队,招募和培养成本不小,而且很难招到既懂医疗又懂数据还懂运营的复合型人才。完全依赖外部咨询又容易造成“咨询公司离开后能力真空”的问题。我的建议是“外部顾问做教练,内部人员做队员”:外部团队负责方法论导入、复杂建模和项目管理的初期主导,医院内部选拔2至3名有潜力的人员深度参与全过程,通过18周左右的项目周期实现知识转移。项目结束后,内部团队能够独立承担常规分析任务,外部顾问退居为月度质控支持。
这种模式看起来节奏偏慢,但实际留存的长期收益显著优于全程代办的模式。

我经常对医院管理者说一句话:数据资产的真正价值,不取决于数据中心里存储了多少个T字节,而取决于院长在开运营管理会时,能做出多少个由数据支撑的决策。一家每天产生数十GB数据的医院,如果核心管理层开会对数据的引用频次接近于零,那它拥有的只是“数据库存”,不是“数据资产”。临床数据与运营数据的融合,本质上是一场管理的再造,是把医疗质量和经济运行放在同一张桌面上讨论。这条路没有捷径,但有相对高效的路径。
如果你正在一家医院或医疗集团推进数据分析相关工作,我建议你从今天开始做三件事:第一,列出过去一个月院领导开会时提出的最让你答不上来的10个经营或临床质量问题;第二,从这10个问题中挑出和你医院医保结算、病种成本、平均住院日最相关的一个;第三,拿着这一个问题去和信息科、病案室、财务科一起开一次数据对齐会,不必追求立刻有答案,但要弄清楚:回答这个问题需要哪些数据?
这些数据的口径是什么?目前的质量能否支撑分析?当你把这一件事彻底做完,你会比讨论一百个宏大概念都更接近医疗数据分析的真实世界。
医疗行业的临床与运营数据分析,正在从“看报表时代”进入“问问题时代”。推动医院管理水平质变的,不是数据分析师的数量,也不再是BI工具的迭代速度,而是院长和科主任们使用数据的方式,以及他们提出的问题质量的提升速度。


读者评论
作为三甲医院运营部的人,太有同感了。每次院长问“为什么亏损”,我们只能给趋势图,给不了归因。文章说的“数据电子化率99%,但真正被读取的不超过5%”很真实。DRG医保结算数据确实是现在唯一能打通临床和运营的抓手,我们也在做。
信息科数据组被说中了,每天导出Excel、手动做透视表,大量时间耗在重复劳动上。文中提到的“跨系统取数排队14天”一点不夸张,问题在于字段口径不统一,想分析什么都要先人工核对。希望医院领导能看到这篇文章。
作为临床科主任,想做个单病种质控分析太难了,病案首页诊断编码和EMR里对不上,还得让学生手工去核。文章把这种困境讲得很清楚,公共数据服务能力跟不上,临床需求只能被压着。建议医院真的该培养懂临床逻辑的数据分析人才。
做医疗数据咨询的,很认同“稀缺的是翻译官”这个判断。文中的“翻译断层”总结到位:同一患者,临床、医保、运营看的维度完全不同。从DRG盈亏归因切入确实是破局点,比建数据大屏实在得多。