在 A*STAR 生物信息学研究所做 IHC 分析时,我做的流程包括组织检测、染色标准化、细胞核分割和特征提取,后面再接分类。
写进简历里是几行字。真把流程摊开,前面的每一步都会影响后面的结果。
比如细胞有没有分对。几个挤在一起的细胞被当成一个,后面提取出来的特征就已经变了。分类模型收到这些数据以后,也不知道原图上发生过什么。
所以我会在意中间结果能不能看。原图是什么样,分割边界落在哪里,哪些区域被排除了,最好能放在一起对照。只有最后一张成绩表,很难往回找原因。
这个项目用到过随机森林。选方法时,我更想先弄清楚特征里包含了什么,以及结果应该怎么验证。模型名字本身,对我判断这件事帮助有限。
还有“能跑完”和“适合拿来反复用”的差别。要处理整张切片,就得考虑耗时、失败的位置,还有别人能不能复现这次结果。这些问题在样本少的时候容易被放过去。
后来做生成式 AI,我还是会想看中间过程。最后给了一个不对的结果,至少得能找到是哪一步开始偏了。研究项目留下的这个习惯,到现在还挺有用。
项目里的方法和评估结果单独放在这里。