Nature 2026|人类蛋白质组再扩张:7,264 个非经典ORF,1/4 真在翻译
人类蛋白质组到底还"藏"着多少未知蛋白?由 TransCODE 联盟在 Nature(2026)发表的大规模研究给出答案:在整合 95,520 个蛋白质组学实验后,约 25%(1,814 个)的 7,264 个非经典开放阅读框(ncORF)能检出真实肽段——由此把"微蛋白(microprotein)"与一类功能未明的"肽蛋白(peptidein)"正式纳入人类蛋白质组参考注释,并提出一套分级证据框架。
研究背景:被"漏掉"的蛋白质密码
过去十年,非经典开放阅读框(ncORF)的翻译在多种人类细胞与疾病状态中被反复观察到。但一个根本争议始终悬而未决:这些 ncORF 究竟哪些真的编码了稳定、有功能的微蛋白?由于它们大多短小、低丰度,传统注释库(GENCODE、UniProt)极少收录,导致大量潜在的"人类蛋白"长期游离在参考蛋白质组之外。
TransCODE 联盟联合全球数十个蛋白质组学中心,对 ncORF 的蛋白水平证据进行了一次共识性全景梳理:整合 95,520 个质谱实验,建立非 HLA 与 HLA 两套 PeptideAtlas,并用多层证据(肽段、Ribo-seq、HLA 免疫肽组、进化约束、功能基因组学)对 7,264 个 ncORF 进行分级注释,最终提出"肽蛋白(peptidein)"这一新概念。
一、规模空前的数据整合:两套 PeptideAtlas 怎么搭起来的
研究以 GENCODE 支持的 7,264 个 Ribo-seq ncORF 为查询集,检索了人类蛋白质组领域积累的海量公开质谱数据:
非 HLA 库:
覆盖 5.73 亿条 MS/MS 谱、1,172 个实验,鉴定出 280 万条独特肽段; HLA 库:
覆盖 2,800 万条谱、592 个实验,鉴定出 86 万条独特肽段(来自 2.4 亿条 HLA 相关谱)。
随着数据集不断加入,可检出的肽段与蛋白数量持续累积(图1)——这正是大规模、社区化蛋白质组学数据的力量:单个实验室难以企及,却能为"微蛋白是否真实存在"提供坚实的统计底座。

二、不是"算出来",是"测出来":靶向质谱坐实内源肽段
质谱鉴定 ncORF 肽段,最怕假阳性。研究用靶向蛋白质组学(PRM)对候选肽段做了"回头验证":以 Tier 1A 微蛋白 c11riboseqorf4 的内源肽段 ATPGHTGCLSPGCPDQPAR 为例,在 HeLa S3、HEK293、K562 三种细胞裂解液中,内源肽段与合成重标肽段的离子跃迁高度吻合(图2),确凿证明这是真实存在、可被重复检测的内源微蛋白肽段。
在大规模搜索层面,团队还用 KO 对照、独立搜索引擎交叉验证:仅 2.5%(183/7,264)的 ncORF 在常规酶解数据中以≥1 个肽段检出;而在 HLA 免疫肽组中,24.6%(1,785 个)ncORF 检出共 3,116 条肽段,其中 94.3% 经独立验证。严谨的证据链,是后续所有结论的基石。

三、免疫肽组的惊喜:ncORF 肽段也"登堂入室"到 HLA 上
HLA 免疫肽组(把细胞表面呈递的肽段"亮"出来)本是为抗原发现而生,却被这项研究证明是 ncORF 检测的"富矿"。团队从总肽段中逐级筛选(HLA-I 阳性、长度 8–12 aa、具已知 HLA 分型),发现大量非经典来源肽段同样稳定呈递于 HLA-I / HLA-II,且在癌症与非癌样本中的分布呈现差异(图3)。
这意味着:微蛋白不仅是"细胞内的小蛋白",还可能被呈递到细胞表面、进入免疫识别——对肿瘤新抗原、疫苗抗原发现具有潜在价值,也为"微蛋白是否真的被翻译并加工"提供了独立旁证。

四、如何分辨"真蛋白"?新工具 ORBL 用进化约束打分
"能检出肽段"不等于"是真实蛋白"。研究提出 ORBL(ORF Relative Branch Length,ORF 相对分支长度)这一进化分析工具:基于灵长类等多物种比对,计算某个 ncORF 在系统发育树上的约束程度(ORBLq)。
结果发人深省:2,211/7,264(30.4%)个 ncORF 的 ORBLq > 0.9,远高于随机预期的 10%;而用传统氨基酸守恒指标 PhyloCSF 打分,仅 2.0%(143 个)超过阈值。换句话说,进化约束比序列守恒更能识别"被认真保留"的 ncORF——为优先注释哪些微蛋白提供了量化依据(图4)。

五、功能证据:51 个 ncORF 是"泛必需"的
蛋白是否"有用",最终要看功能。团队用 CRISPR–Cas9 功能缺失筛选(8 个细胞系、25 个筛查)结合表达证据过滤,鉴定出 51 个具"泛必需性"敲除特征的 ncORF——敲掉它们,细胞普遍长不好(图5)。
其中 c10riboseqorf92(定位于 ZBTB11-AS1 转录本)是典型代表:重新表达可回补表型,提示其具有 ORF 特异性功能,而非邻近 CDS 的副产物。这些结果把"微蛋白"从"能检出"推进到"有明确细胞功能"。

六、它们真的能"折叠成蛋白"吗?结构预测给出肯定答案
会不会只是一串"凑巧被翻译"的肽链?研究用 AlphaFold3、ESMFold、OmegaFold 对 ncORF 编码序列做结构预测,并按证据等级(Tier)分层比较 pLDDT(结构置信度)。
结果清晰:证据等级越高的 ncORF,结构预测置信度越高(图6),明显优于随机打乱序列的对照。说明高优先级微蛋白不仅能翻译,还大概率能折叠成稳定的三维结构——进一步支持把它们当作"真蛋白"纳入参考注释。

七、给做蛋白组学的你:这篇 Nature 带来三点启示
① 大规模、社区化数据 + 严谨验证,是微蛋白发现的出路:
单实验室数据有限,整合公共库 + PRM 靶向回验证,才能把"疑似"变成"确证"。 ② 免疫肽组是新蓝海:
HLA 呈递的 ncORF 肽段,为肿瘤新抗原、疫苗靶点发现打开新窗口,值得在项目中重点布局。 ③ 进化约束 + 功能筛选,是优先级排序的关键:
面对海量候选 ncORF,ORBL 这类量化指标能帮你把有限的验证资源押在最可能"成蛋白"的目标上。
开泰生物提示 如果你正关注新型蛋白/微蛋白发现、HLA 免疫肽组、或 ncORF 功能验证,我们可提供 DIA / 无标记定量(LFQ)蛋白质组学 + PRM 靶向验证 + 免疫肽组学全流程服务:从实验设计、样本制备、深度质谱鉴定到生信分析与候选优先级排序,一站到位,帮你把"组学大数据"真正转化成可发表的生物学结论。
八、研究亮点与局限
亮点
迄今最大规模的 ncORF 蛋白水平证据整合(95,520 实验) 多层证据框架 + PRM 靶向回验证,假阳性控制到位 提出 ORBL 量化工具与 peptidein 新概念,可操作性强 从检出 → 进化约束 → 功能筛选 → 结构可折叠,证据链完整
局限
证据仍以"肽段检出 + 计算预测"为主,独立生化功能验证的 ncORF 仍有限 微蛋白的真实亚细胞定位、相互作用网络大多尚未阐明 纳入标准偏向较长 ncORF,大量 <18 aa 的超短 ORF 仍难纳入参考注释
一句话核心结论 Nature 2026 的 TransCODE 研究整合 95,520 个蛋白质组学实验,证明约 25% 的 7,264 个 ncORF 能检出真实肽段;以 ORBL 进化约束、CRISPR 功能筛选与结构预测层层把关,把"微蛋白"与"肽蛋白"正式纳入人类蛋白质组参考注释——为非经典 ORF 的功能研究树立了新标杆。 论文信息 标题:Expanding the human proteome with microproteins and peptideins 期刊:Nature(2026)Vol 654, 18 June 2026, pp 813–(TransCODE Consortium) 关键词:ncORF · microprotein · peptidein · PeptideAtlas · ORBL · 人类蛋白质组


English

