蛋白质保守结构可以帮助识别被断裂的编码区域,但远缘同源、基因家族和非编码区域限制了方法范围。
从完整蛋白质寻找被拆开的基因
低连续性组装可能把同一个蛋白质编码区分散在不同 contig。将已知蛋白与多个片段对齐,可以发现它们按蛋白质顺序覆盖不同部分,并据此提出 scaffold 连接。
这种方法关注基因区域完整性,不是为了连接所有基因组片段。没有蛋白质证据的非编码区域不会因此自动恢复。
同物种蛋白与远缘同源蛋白的差异
同物种高质量蛋白通常提供更直接证据,但非模式物种往往缺少完整蛋白集。使用近缘或更远物种的同源蛋白可以扩大覆盖,却会受到序列分化、基因复制和结构变化影响。
论文显示远缘同源仍可产生高准确率候选,但该结果来自特定测试,不能变成所有物种的固定保证。
连接参数影响数量与准确度
匹配比例、覆盖长度、允许内含子范围和蛋白质完整性都会改变候选连接。阈值越宽松,连接数量可能增加,也更容易把家族成员混合。
评估应同时查看连接数量、修正后的 N50、错组装和完整蛋白覆盖。
蛋白引导与转录本引导互为补充
转录本反映当前样品表达,能够提供剪接信息,却会漏掉未表达基因;蛋白质跨物种更容易取得,但会失去物种特异剪接和非编码信息。
两种证据一致时信心提高;冲突时应回到基因家族、样品条件和原始读长判断。
完整基因是蛋白引导方法的核心评价对象
传统连续性统计关注片段长度,蛋白引导方法更关心编码区域是否被恢复。论文通过蛋白覆盖比例比较原 contig、scaffold 结果和完成组装,说明结构完整性可以独立于 N50 评价。
长蛋白跨越更多外显子和内含子,更容易暴露组装断裂,也更考验匹配与连接准确度。
基因家族会制造错误候选
免疫、嗅觉和代谢相关家族可能拥有多个相似拷贝。一个蛋白的不同片段若分别匹配两个家族成员,程序可能误以为它们属于同一个被拆开的基因。
共线性、read 配对和局部覆盖可帮助排除。使用更严格的唯一匹配条件会减少覆盖,但通常提高解释性。
蛋白质数据库本身也有版本与偏差
Swiss-Prot 人工整理程度较高,TrEMBL 覆盖更广但包含计算注释。不同蛋白集会改变可连接区域和错误风险。
非模式鱼类常借用近缘物种蛋白,资料丰富的家族更容易被恢复,研究较少的基因仍可能缺失。
为什么不能靠蛋白方法恢复整个基因组
蛋白质只覆盖编码区域,调控序列、重复、非编码 RNA 和大片基因间区缺少直接引导。组装的染色体结构仍需长读长、配对资料和物理图谱。
PEP_scaffolder 应被理解为完成基因结构的补充方法,不是通用 de novo assembler。
冲突证据应该保留而不是强行连接
蛋白顺序支持连接,但长读长或共线性不支持时,可能存在基因复制、结构变异或错误蛋白模型。自动流程不应为了提高连续性忽略冲突。
把候选连接和证据层导出,允许人工复核,通常比只输出一个最终 FASTA 更适合科研使用。