矩阵很稀疏但规模很大
单个细胞只检测部分基因,却会产生大量细胞与基因组合。
稀疏格式能减少占用,但后续操作可能产生密集对象。
比较矩阵很稀相关的两批单细胞资料时,即使图表相近,形成过程也可能不同;就矩阵很稀而言,把矩阵很稀涉及的字段、单位、标识和版本写进记录,后续复核时才有机会避免不同文件被错误合并。
质控改变数据规模
过滤低质量细胞、双细胞和异常样本会缩小任务。
阈值过严也可能删除真实生物差异。
邻居图需要额外内存
降维、聚类和图结构会创建矩阵之外的对象。
任务估算要考虑中间结果,而不只是输入文件。
邻居图需进入云端后,传输速度只是单细胞工作的一项条件;就邻居图需而言,邻居图需对应的权限、校验、日志和负责人是否完整,会直接影响任务能否复现,也决定团队是否可以安全地继续协作。
整合多个批次更复杂
样本整合会同时保留批次、细胞类型和校正模型。
分批处理与合理保存点可以降低失败后的重算成本。
比较整合多个相关的两批单细胞资料时,即使图表相近,形成过程也可能不同;就整合多个而言,把整合多个涉及的适用对象、未覆盖条件和不确定性写进记录,后续复核时才有机会防止把局部结果过度外推。
高内存不是越多越好
资源申请过大可能增加排队时间和成本。
先用代表性子集估算,再决定正式任务规模更稳妥。