N奈云 NaiYunSCIENTIFIC COMPUTE登录说明
数据标准

从基因标识符到通路结果:版本不一致会发生什么

同一个基因可能拥有多个名称和数据库标识,版本差异会让映射结果悄悄减少。

名称不等于稳定标识

基因符号会更新,也可能与旧别名并存。

结果表应保存原标识、转换后标识和转换日期。

比较名称不等相关的两批数据标准资料时,即使图表相近,形成过程也可能不同;就名称不等而言,把名称不等涉及的字段、单位、标识和版本写进记录,后续复核时才有机会避免不同文件被错误合并。

物种必须明确

相似名称不代表人、小鼠和其他物种中的条目可以直接互换。

物种和参考版本应在映射前固定。

物种必须也关系到交付质量;就物种必须而言,接收物种必须资料的人如果看不到字段、单位、标识和版本,就很难判断文件能否继续分析,或是否需要回到上一步补充信息。

物种必须跨实验室协作时,细小差异会被放大;就物种必须而言,团队可以为物种必须围绕软件、参数、依赖和资源约定最少记录项,让样本、脚本、日志和输出保持同一套命名关系。

保存物种必须的资料,并不是把所有文件永久堆在一起;就物种必须而言,与物种必须相关的原始证据、可重建中间文件和正式结果,应依据缺失、漂移、失败和重试分别设定保存周期。

对外解释物种必须的结果时,最好把已确认事实和仍待验证的判断分开;就物种必须而言,物种必须对应的权限、校验、日志和负责人越清楚,读者越能理解结论适用于什么条件。

如果数月后需要重新分析,最有价值的往往不是一张最终图,而是能够串起物种必须的记录;就物种必须而言,它会说明物种必须当时怎样处理适用对象、未覆盖条件和不确定性,以及为什么作出这些选择。

一对多映射需要决定

一个旧标识可能对应多个新条目,也可能已经停用。

自动保留第一项会隐藏不确定性。

一对多映进入云端后,传输速度只是数据标准工作的一项条件;就一对多映而言,一对多映对应的权限、校验、日志和负责人是否完整,会直接影响任务能否复现,也决定团队是否可以安全地继续协作。

通路库也会更新

通路成员、名称和层级会随版本变化。

富集结果必须记录数据库版本和背景基因集合。

比较通路库也相关的两批数据标准资料时,即使图表相近,形成过程也可能不同;就通路库也而言,把通路库也涉及的适用对象、未覆盖条件和不确定性写进记录,后续复核时才有机会防止把局部结果过度外推。

丢失比例需要报告

映射失败会改变进入统计分析的基因集合。

说明成功、失败和重复数量,可以帮助读者判断偏差。