样本离开实验台之前
低氧程度、暴露时长、组织来源和采样批次会改变表达结果。
样本表需要在文件上传前确定,不能等分析结束后再凭记忆补写。
原始文件不是完整实验
测序文件保存观察值,却不会自动携带培养条件、处理时间和实验分组。
文件名、样本表与实验记录必须使用可以相互核对的编号。
校验值确认传输结果
大型文件上传完成不等于内容必然完整。
记录文件大小与校验值,可以区分传输中断、重复文件和版本替换。
计算环境也属于结果
参考基因组、软件版本、参数和依赖库都会影响输出。
容器、环境清单或运行脚本应与结果同时归档。
计算环境也关系到交付质量;就计算环境而言,接收计算环境资料的人如果看不到字段、单位、标识和版本,就很难判断文件能否继续分析,或是否需要回到上一步补充信息。
任务队列改变等待方式
共享计算资源会经历排队、运行、重试和终止。
运行状态需要和资源用量、退出代码及日志一起阅读。
中间文件要有去留原则
比对、计数和质控会产生大量中间结果。
保留能够支持复现的文件,临时缓存则按项目规则清理。
结果解释回到实验设计
显著性、富集结果和聚类图不能替代实验条件。
每一张图都应能返回样本、方法与适用范围。
归档让项目继续生长
原始数据、脚本、版本、图表和说明具有不同保存周期。
清楚的目录能让后续成员继续分析,而不是重新猜测整个项目。