一、从一组“显著富集”说起
我第一次对“通路显著富集”这六个字生出警惕,是在一次转录组分析的组会上。那时我在一个做应激反应的课题组做研究助理,日子过得很具体:样本编号、提取批次、RIN值、建库方式(polyA还是rRNA去除)、链特异性、测序深度、比对率、重复样本相关性、差异基因的阈值、富集数据库的版本、n到底等于几个独立生物学重复,还有那句被反复使用的结论——“该通路显著激活、上下游靶点明确、机制链条完整”。有一次我交了一份关于某个处理组的分析报告,写着“FDR<0.05、倍数变化大于两倍、趋势可重复”。带我的老师没否定我,只是把同一份元数据表里被我标成“两个样本因‘聚类异常’剔除”和“三个参考基因组注释版本里只报了GO条目最多那一个”的那两处抽出来摊开,问了一句:这个“显著”,是这条通路真的被调动了,还是你先知道了答案该有变化,再给它挑了一批最配合的剔除标准、一个最顺手的归一化方式和一份最肯给条目的注释库?
那天我从服务器机房出来,队列还在跑。我第一次承认,自己对上的是一组筛出来的图,而不是那个因为系统性地把最难解释的批次效应、最不服从的两个离群样本和最含糊的基因集定义提前排在了叙述之外、才让“完整”显得成立的版本。我把“p值够小”当成了“结论稳”,把“热图好看”当成了“机制清”,把流程跑通了当成了问题想明白了。于是我想回去读书,想回到“生物学问题—可检验假设—数据生成机制—统计推断—独立验证”这条链的道理本身,而不是它的验收话术。我报了中国科学院大学的生物信息学方向。
二、公共课:慢一点,反而快
政治我从四月开始,不赶进度。每天一小时,先看知识点,再刷选择题,最后两个月才动主观题。我的办法是把每个专题往自己的专业上靠:基础研究长期投入与国家生物信息基础设施(国家生物信息中心、算力平台、科学数据库是典型的重平台投入)、生物安全法与人类遗传资源管理条例(人类遗传资源采集保藏出境审批、知情同意、数据去标识化、重要遗传家系与特定地区人类遗传资源申报)、数据安全法与个人信息保护法(健康医疗数据分类分级、受控访问与数据使用协议、跨境传输)、健康中国行动与精准医学(肿瘤早筛、罕见病诊断、药物基因组学、伴随诊断监管)、人工智能治理与算法备案(生成式AI服务管理、训练数据合法性、模型偏倚与可解释性)、种业振兴与生物育种(种质资源与基因组选择)、双碳目标与微生物固碳、科研诚信与学术不端治理(p-hacking、选择性报告、图像与可视化误导、事后假设当先验、论文工厂与代投)。同一个话题,我逼自己答三层——它是什么、为什么现在提、在生物信息学上对应哪类数据哪条合规要求。这样写出来的东西有筋骨,考场上不至于空。
英语我更不敢偷懒。单词从三月背到考前,一天不落;阅读一天一篇精读,拆主干、找同义替换,顺手攒专业词汇:alignment、assembly、annotation、variant、enrichment、heterogeneity、reproducibility、benchmark。写作我自己搭框架,改到看不出模板的痕迹。这门学科要求人把假设、推理和适用范围说清楚,英语其实是同一件事。
另外要提醒一句:生物信息学的初试科目跨度极大——有的单位考数学(常见为数学二,少数考数学一),有的单位不考数学而考生物化学与分子生物学或细胞生物学,还有的计算机口径单位考数据结构与算法或计算机学科专业基础。这一点我一开始就核对清楚了,免得拿着“带‘信息’二字必考408”或者“挂在生物学下就不考数学”的旧印象白练一年——下面细说。
三、专业课:先说一件更重要的事
“生物信息学”在国科大体系里不是一个全国统一编码的二级学科,而是以自设交叉学科的形式挂在多个一级学科下面。 这是最容易踩坑的一步,而且比纳米那套更绕。以近年目录为例:你会看到生物学(0710)下的自设二级学科“生物信息学”(代码多为0710Z×),也会看到计算机科学与技术、软件工程、基础医学、农学门类下同名或近似名的方向,还会看到交叉学科门类下的相关一级学科以及电子信息(0854)、生物与医药(0860)等专硕口径。也就是说,同一个“生物信息学”名字,可能对应理学、工学、医学、农学四个不同的学位授予口径——学位证上写的专业和你能报的方向,取决于你报的是哪一个代码。更要紧的是:这些代码的研究方向名称高度重合(“基因组学与群体遗传”“单细胞与空间组学”“蛋白质结构与计算生物学”“微生物组与宏基因组”“疾病组学与精准医学”“进化与比较基因组”“算法与数据库”),光看方向名你根本分不清自己报的是生物学还是计算机;而相邻方向的服务器可能就在同一个机房,考试科目却完全不同。这一步如果搞错,去搜“生物信息学考研科目”,百分之百会被方向名带偏。
国科大做生物信息学的单位主要有中国科学院北京基因组研究所(国家生物信息中心,北京,国家基因组科学数据中心NGDC)、中国科学院上海营养与健康研究所(生物医学大数据中心)、中国科学院深圳先进技术研究院(深圳合成生物学创新研究院、医工所)、中国科学院昆明动物研究所(遗传资源与进化国家重点实验室)、中国科学院微生物研究所、中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院软件研究所、中国科学院生态环境研究中心、中国科学院青岛生物能源与过程研究所、中国科学院天津工业生物技术研究所、中国科学院大连化学物理研究所,并与北京生命科学研究所、华大等机构有联合培养;高校系统的传统重镇(如北大、清华、复旦、上交、华中科大、中山、浙大、中国农大等)报考路径不同但研究内容高度相关。这里有个必须单独强调的大坑:部分单位的研究生学籍不在国科大而在合作高校(如深圳先进院与深圳理工大学、部分与中科大/复旦等联合培养项目),你想去的“那个所”走的是另一套目录、另一套初试科目和另一条分数线——别拿着国科大的大纲复习一年才发现报错了学校。反过来,想报国科大系统的生物信息,重点看国家生物信息中心、上海营养与健康所、昆明动物所等。
好消息是:国科大统一命题科目的考试大纲由国科大统一发布(约每年7月公布在招生信息网),同一张卷子在不同单位通用,真题可以跨单位练。坏消息同样明确:你报的代码决定了你考哪一套。以近年情况为例,常见组合包括①101思想政治理论②201英语(一)③一门业务课一(如数学二/生物化学与分子生物学/普通生物学/计算机专业基础等)④一门业务课二(如生物学综合/生物化学与分子生物学/数据结构与算法/程序设计等,具体以当年目录为准);偏基因组与群体的多考数学加生物学综合或生化,偏算法与系统的多考计算机类科目,偏医学组学的多考生化或细胞生物学加生物学综合。报名前请逐项核对院系所代码、专业代码和科目代码,尤其要确认第三门到底是数学二、生物化学与分子生物学还是计算机专业基础,第四门到底是生物学综合还是数据结构,这一步做错了,后面全是无用功。更要紧的是分数线差异极大且年年波动,单科还有硬杠:有的年份总分线能到三百三十以上,次年可能落到二百九十分附近;总分过了、专业课差几分一样进不了复试,且推免与直博占比很高,统考名额有限且每年调整,个别专业某年只招推免生。另外提醒一句:涉及人类样本、临床表型与组学数据的方向须符合伦理审批、知情同意、人类遗传资源管理与数据去标识化要求,且受控访问数据(如dbGaP/GSA类)须遵守数据使用协议,不得超范围使用;涉及病原微生物基因组、毒素、合成序列的方向有专门的生物安全等级与审批要求;涉及实验动物的方向须通过伦理审查并遵守3R原则、麻醉镇痛与人道终点规范,以当年招生简章和专业目录的规定为准。
第一条主线取决于你考的是数学、生化、普生还是计算机,我抓的是同一件事:变量、分布与因果。如果考数学,就把高数—线代—概率统计串起来,然后问自己“它在组学数据里长什么样”——矩阵分解与降维(SVD/PCA的几何意义、特征值衰减)、最小二乘与正则化(L1/L2的几何差别、稀疏性从哪来)、梯度与凸性、马尔可夫链与隐马尔可夫模型、极大似然与贝叶斯、假设检验的功效与效应量、多重检验校正(Bonferroni保守性与BH-FDR的独立性假设)、广义线性模型与负二项分布、混合模型与随机效应(这是后来一切“批次是不是能当随机效应”的根);如果考生化与分子,就把中心法则—表达调控—表观遗传—信号通路串起来,然后问“这个生物学事实在数据里留下什么信号、会被什么技术噪声掩盖”——polyA与rRNA去除捕获的RNA集合不同、链特异性决定反义转录本判读、UMI解决PCR重复但不能解决分子内重复、ChIP-seq需要input/IgG对照且peak calling对对照敏感、ATAC-seq的Tn5偏好性与核小体相位、Hi-C的分辨率由有效读段数决定而非总读段数、质谱DDA与DIA的缺失值机制不同;如果考普通生物学,就把分子—细胞—组织—个体—种群层级搭起来,不许只背名词不背判据——同源/直系/旁系怎么分、orthology推断靠什么证据、相关性与因果性怎么判、遗传力与环境影响怎么分;如果考计算机,就把数据结构—算法—系统串起来,然后问“它在序列数据上怎么落地”——哈希与k-mer计数、后缀树/后缀数组与BWT/FM-index(这是所有短序列比对的根)、动态规划与Needleman–Wunsch/Smith–Waterman、BLAST的seed-and-extend与E值含义、图与de Bruijn图组装、最短路与最小生成树、并查集与聚类、NP-hard与启发式、时间空间复杂度与外存/并行。这一门最容易丢分的地方恰恰是最基础的:有效数字与误差传递没算、对照组没设(无处理对照、input/IgG、 scramble、空载体、同窝对照、技术空白)、把技术重复当生物学重复、把细胞数当样本数、把reads数当n、把拟合优度当机制证明、把相关当因果、把“富集到了通路”当“通路被激活”(基因集富集≠通路活性,需独立的功能证据)、把TPM跨数据集比较(文库构成不同,TPM不可跨实验直接比)、把聚类结果当真实亚型(分辨率是人为设定的)。学到负二项模型与离散度收缩那一段我停得最久,因为那是后来一切“这个差异到底是不是噪声”的根;学到批次效应与混杂那一段我又停了一次,因为那是“显著信号来自生物学还是来自星期几做的实验”的分水岭。
第二条主线是生物信息学专业内容,我抓的是“问题—数据—模型—推断—验证”,每一环都问三件事:它的前提假设是什么、它的噪声结构是什么、它不能证明什么。我从基因组与变异出发,把参考基因组与注释版本(hg19/hg38/mm10/GRCm39与GENCODE/RefSeq版本差异,坐标转换liftover的丢失)、测序原理(桥式扩增、边合成边测序、错误模式与Q值Phred口径、读长与插入片段、双端与单端、覆盖深度与覆盖度、PCR重复与UMI)、比对(BWA/HISAT2/STAR的参数与软裁剪、多映射reads处理、配对一致性)、变异检测(SNV/indel的局部重比对、VQSR与硬过滤、CNV的读深与断点、SV的split-read/read-pair/assembly证据、STR、线粒体异质性、嵌合与污染检测、家系trio一致性、孟德尔冲突率)、群体遗传(Hardy–Weinberg检验、LD与r²口径、单倍型、有效群体大小、Fst/Tajima's D/iHS等选择扫掠指标、PCA与群体分层、admixture、亲缘与IBD、GWAS的线性混合模型与基因组控制λ、曼哈顿图与QQ图解读、精细定位与共定位、PRS的族群迁移性陷阱)串成一条链,记住每一个指标的定义、分母、适用条件;进入转录组与单细胞,把定量(featureCounts/HTSeq计数口径、基因长度与GC偏差、TPM/CPM/TMM/quantile的选择前提)、差异表达(DESeq2/edgeR的size factor与离散度估计、limma-voom、log2FC收缩、独立过滤)、可变剪接(PSI口径、事件类型、isoform定量的非唯一性)、融合基因、WGCNA与模块、单细胞流程(质控阈值、doublet检测、归一化与高变基因选择、批次整合Harmony/CCA、降维UMAP/t-SNE的超参依赖与距离不可比、聚类分辨率任意性、marker基因的层层检验与多重校正、细胞类型注释的参考依赖与误标风险、轨迹推断的前提与方向不可识别、RNA velocity的稳态假设、拷贝数与CNV推断、空间转录组的spot混合与去卷积)串起来,永远先问“这个亚群是不是换个整合方法就消失”;进入表观与三维基因组,把DNA甲基化(WGBS/RRBS/EPIC的覆盖差异、β值与M值、细胞类型混杂)、染色质状态(ChIP-seq对照、ATAC-seq峰值、chromHMM)、Hi-C(矩阵标准化、KR/ICE、TAD calling算法依赖、compartment A/B、loop的FDR、有效深度与分辨率换算)、eQTL/sQTL/caQTL与colocalization串起来;进入蛋白与结构,把序列比对与谱、隐马尔可夫模型与结构域、同源建模、折叠预测类方法的原理与局限(MSA与模板依赖、单构象输出、IDP与复合物/配体/PTM处理弱、pLDDT/PAE的正确解读)、对接与打分、分子动力学与自由能的收敛判据、质谱蛋白组(搜库FDR、肽段唯一性、缺失值机制与imputation的双刃性、DIA定量、PTM定位概率)串起来,每一种都要求能说清它的盲区;进入宏基因组与微生物组,把16S(OTU/ASV口径、引物偏好、拷贝数校正、α/β多样性指数的口径差异)、鸟枪法(宿主去污、组装与binning、MAG完整性与污染评估CheckM、功能注释KEGG/eggNOG/CAZy)、组成数据的本质(总和约束、clr/ilr变换、差异丰度方法的假阳性差异)、菌株水平分辨与水平基因转移串起来,永远先问“这个差异是不是DNA提取试剂盒和引物决定的”;进入机器学习与工程实践,把交叉验证的正确嵌套(特征选择与调参必须在训练折内)、类别不平衡与PR-AUC、泄漏(样本级泄漏、亲属泄漏、批次泄漏、时间泄漏)、可解释性的陷阱、深度学习在序列与结构上的应用与外部验证、工作流与可重复(Linux/shell、Python/R、conda/singularity、Snakemake/Nextflow、Git、随机种子、容器与版本锁定、算力与并行、存储与备份)、数据库与资源(NCBI/ENA/SRA/GEO/GTEx/TCGA/ICGC、Ensembl/UCSC、dbSNP/gnomAD/ClinVar/COSMIC、UniProt/PDB、KEGG/Reactome/GO/MSigDB、GTDB、NRL/NOMAD类资源、ISO/行业标准)串起来,最后补一块研究伦理与合规:知情同意范围与二次使用、受控访问申请、去标识化与再识别风险、人类遗传资源出境与材料转移、病原序列共享约定、结果回传与临床可行动变异的报告边界。这门课的易错点不在难题,在单位和基准:bp/kb/Mb与染色体坐标(1-based与0-based口径,BED半开半闭区间,写错一格整段位移)、read length与insert size bp、×(覆盖深度,注明是平均还是中位、是否含未比对)、Q值Phred(Q30=0.1%错误率,注意是per-base)、UMI长度与纠错半径、% mapped、% duplicate、RIN阈值、FPKM/TPM/CPM/counts不可混用且TPM不可跨数据集比较、log2(TPM+1)的伪计数选择会改变排序、p值与adj.P/FDR(注明校正方法与层次)、log2FC与绝对表达量、效应量与置信区间、n是生物学重复数/个体数而非细胞数/reads数/技术重复数(嵌套伪重复是组学领域最常见的扣分点)、批次/性别/年龄/PMI/取材部位作为协变量是否纳入、参考基因组与注释版本必须写明、链特异性、paired-end、多映射与低质量reads的处理策略、基因长度与GC偏差、dropout率与零膨胀、imputation引入的假相关、聚类分辨率参数、伪时间单位不可比、物种交叉污染(如PDX的小鼠reads、微生物组的试剂空白)、丰度%与相对丰度的总和约束、OTU/ASV口径、α多样性指数种类、Fst/Tajima's D的窗口大小与步长、LD r²与D′、MAF阈值、HWE p值阈值、λGC、AUC与PR-AUC在极端不平衡下的解读、校准曲线、运行时间与内存、任何一处写错,整道论述题就悬空。手上功夫不能省:九月起我每周两次三小时限时手写,名词解释按“定义—要点—例子”三段式写,论述题按“问题界定(体系/数据类型/样本量与重复层级/口径)—链条与控制环节(数据生成机制—噪声来源—建模假设)—定量关系与判据前提(公式写清变量、分母与适用条件)—关键设计与对照(必要性:剔除/置换检验;充分性:独立队列/外部验证;独立性:另一种算法或另一种平台交叉)—替代解释(批次与混杂、版本与口径、参数调优、嵌套伪重复、泄漏、离群样本驱动、参考偏倚)—局限与独立验证(湿实验或第三方数据)—生物学与应用意义”写,不许跳步,不许写“显然”“众所周知”糊弄自己;错因簿分“概念混淆、层次误用、单位与基准失当、案例失当、计算失误、条件漏检”六类,每周翻一次。真题按考点归类后你会发现,重复出现的那一半就是你的基本盘;同一道题隔两周重做一遍,不看答案,直到能从头写到尾不卡壳——熟练从来不是看懂,是重写。
复试要早准备。总成绩一般按初试折算占一半、复试占一半计算,复试不及格者不予录取;各单位自划线,差异极大且年年波动,单科还有硬杠。我会提前做三件事:一是补初试没考但面试常问的内容,比如方法原理(一个算法测的是什么、前提是什么、主要失效情形是什么:BWT为何省内存、de Bruijn图的k选择与重复序列、UMAP距离不可比、t-SNE困惑度、Harmony整合可能抹掉真实生物学差异、CNV read-depth对GC与 mappability 的依赖、colocalization与简单重叠的差异、PRS的族群迁移性、AlphaFold类方法的置信度解读、imputation的双刃性、FDR在相关特征下的保守性)、编程与工程(Linux/shell熟练度、Python/R手写数据处理、SQL、git、Snakemake/Nextflow、SLURM、复杂度分析、调试与 profiling、绘图规范与可重复报告)、数据来源与可靠性(上述数据库的版本与口径、公开数据集元数据完整性、能否复现一篇论文的figure)、研究设计(科学问题怎么从“差异基因列表”提炼成可检验的时空因果假设、如何区分原发与继发、如何区分技术批次与生物学分组、对照与随机化盲法怎么设、预注册与剔除标准怎么定、样本量与功效怎么算)、伦理与安全;二是养自己的“手感”:读一篇论文先不看结论,问它的n层级够不够、有没有独立队列验证、有没有湿实验或正交平台交叉、不确定性的系统项给了哪些、结论是不是换个版本或换个参数就反转;三是准备一个自己能讲透的问题(某个信号是批次还是生物学、某个亚群是真实还是算法产物、文献值与实测落差从哪来)。面试时老师最爱问三句:你这个结论依赖什么假设?换一个队列或换一个平台还成立吗?给我一个纯技术的解释(artifact)。接得住这三问,比多刷十套题有用。
四、要不要报班
这件事没有标准答案,但有几个事实最好先弄清楚。第一,盘子小且散,推免和直博占比很高,留给统考的名额有限,且各单位每年调整(有的专业某年只招推免);第二,分数线年年波动,单科还有硬杠,总分过了、专业课差几分一样进不了复试;第三,这个方向的入口特别容易搞错两层:一层是“生物信息学”作为自设交叉学科挂在生物学、计算机、基础医学等不同一级学科下,另有交叉学科门类的相关口径与专硕口径,你必须先确定自己报的是哪个代码、拿的是哪个门类的学位;另一层是机构归属与学籍——部分单位的学籍在合作高校而非国科大,想做单细胞或宏基因组的同学如果按国科大目录复习就全错了。此外还要留意新增交叉学科与专硕科目的年度调整,别拿旧目录来套。如果你本科生物、统计、数学、计算机背景扎实、编程与数理基础好、信息渠道清楚、自律性强,自学完全够;如果你是跨专业(尤其从临床医学、药学、农学、环境、机械、电子转来做生物信息学)、二战,或者连专业代码、科目代码和学籍归属都没核对明白,就别硬扛,找人帮你把节奏排好,省下的是一年时间。
我现在在新祥旭考研担任理工科方向的专业课辅导老师,带的是一对一规划。我会先看你的本科背景、数理与编程基础和可用时间,帮你先厘清该报生物学下的生物信息学,还是计算机科学与技术、软件工程、基础医学、农学门类下的相关方向,或是电子信息、生物与医药等专硕口径,再逐项核对当年的院系所代码、专业目录与报考条件,确认你报的单位第三门考数学二、生物化学与分子生物学还是计算机专业基础、第四门考生物学综合还是数据结构与算法、用什么版本的大纲,然后把公共课与专业课的双线复习表、三轮模考表和复试抢跑计划(含编程与统计补强)一条条排出来。新祥旭考研的全科定制辅导可以按你的基础和时间量身定制方案,公共课和专业课一起安排,不让你在某一门上单独耗掉全部精力。如果你正在备考中国科学院大学生物信息学,或者同校的生物化学与分子生物学(071010)、遗传学(071007)、细胞生物学(071008)、微生物学(071005)、生物物理学(071011)、生态学(0713)、计算机科学与技术、软件工程、电子信息、生物与医药、基础医学,欢迎来找我聊聊。
(文中涉及的专业代码、报考条件、初试科目、考试大纲、招生计划、复试办法与分数线等,请以中国科学院大学招生信息网及中国科学院北京基因组研究所(国家生物信息中心)、上海营养与健康研究所、深圳先进技术研究院、昆明动物研究所、微生物研究所、计算技术研究所、自动化研究所、软件研究所、生态环境研究中心、青岛生物能源与过程研究所、天津工业生物技术研究所、大连化学物理研究所等培养单位当年公布的官方文件为准;各单位的研究方向、考试科目、招生规模及学籍归属每年可能调整,报名前请逐项核对。)


















