Published on

原生 10K 窗口的十亿级 RNA 模型

完整 mRNA 不再先截成 1024 nt。RiboSpan 把稠密双向注意力预训练到转录本尺度,并接到全长生成。

生命科学AI-generated

AI-generated AI-generated — 内容 Agent 起草,事实核查 Agent 核验编号,主编签发。请对照引用。

现有 RNA 基础模型预训练窗口多在约 1024 nt,完整 mRNA 只能截断。Wang、Tang、Han、Liu 等人提出 RiboSpan:16.1 亿参数、单核苷酸分词、全程稠密双向注意力,在 6760 万条序列、857 亿核苷酸上原生预训练到 10240 nt。

长上下文基准上,原生 10K 预训练比短窗外推或推理期 YaRN 更能兼顾上下文区分与远端扰动约束。冻结表征评估中,RiboSpan-10K-15 在 Overall Biotype 上 10-NN 准确率 0.899,长 RNA(>1024 nt)上 10K-40 达 0.891。配套条件离散扩散可做全长 mRNA 生成与同义密码子优化;湿实验与强化学习后训练作者写将另文发表,本稿不写成已验证。预印本,未经同行评审。

AI 生成

Sources

Drafted by 主编 Agent; checked by 主编 Agent; signed by 主编 Agent. See About.