生信入门实战 分子对接 · 组学分析 · 跑通为准
总览 / 工具与环境

工具与环境安装

这一页只解决一件事:把 R、Python 和 conda 环境管理装好,并且以后每换一个项目都能干净隔离。装环境是生信里最容易被跳过、也最容易反复出事的一步。

一、conda:环境管理器(最先装)

不同生信软件依赖不同版本的 Python、R 和编译库,全装在一个环境里必然冲突。正确做法是每个项目一个独立环境。conda 就是干这个的;嫌它慢的话,装 mamba 或 micromamba 替代。

名称链接说明
Minicondadocs.conda.io官方推荐的最小安装版,比完整版 Anaconda 干净得多
mambamamba.readthedocs.ioconda 的 C++ 重写版,解依赖快很多,命令基本兼容
conda 官方中文文档 · 环境管理docs.conda.org.cn创建、激活、导出、删除环境的标准操作
Biocondabioconda.github.io生信软件的 conda 频道,3000+ 软件一条命令装好

核心命令(建议先复制跑一遍)

bash
# 装好 Miniconda 后,先给 base 环境装上 mamba(更快)
conda install -n base -c conda-forge mamba

# 为某个项目建独立环境
mamba create -n docking python=3.11
mamba activate docking

# 一次装齐相关软件(不要一个个装,容易依赖冲突)
mamba install -c conda-forge -c bioconda autodock-vina openbabel rdkit

# 导出环境,方便别人复现你的结果
mamba env export > environment.yml
踩坑提示

不要在 base 环境里装生信软件。污染之后很难修,最后通常只能整个重装。

二、R 与 RStudio

差异表达(DESeq2、edgeR)、富集分析(clusterProfiler)、统计与作图是 R 的主场,Bioconductor 生态无可替代。

名称链接说明
R 官网r-project.org下载 R 本体
CRAN 镜像列表cran.r-project.org就近选镜像,装包速度快很多
RStudio Desktopposit.coR 的集成开发环境,写脚本、看图、看变量都在一个窗口里
Bioconductorbioconductor.orgR 生信包总库,每个包都有 vignette,最权威的教程来源
r
# 装 Bioconductor 包的标准姿势
if (!requireNamespace("BiocManager", quietly = TRUE))
    install.packages("BiocManager")

BiocManager::install(c("DESeq2", "clusterProfiler", "org.Hs.eg.db", "enrichplot"))
install.packages(c("ggplot2", "pheatmap", "apeglm"))

R 不必一开始就精通。先掌握「读入数据 → 整理 → 画图 → 跑统计」这条线,够支撑后面的分析;深度美化可以晚点再说。

官方源太慢时,换国内镜像

Bioconductor 的包动辄几十到几百 MB。我们在云主机上实测过:从官方源直连只有 5 KB/s 左右,一个 org.Hs.eg.db 要拖几个小时;换成国内镜像后同一批包跑到 20 MB/s 以上,几十秒装完。这一步不换源,很多人会卡在这里以为是自己网坏了。

r
# 临时用一次
options(BioC_mirror = "https://mirrors.westlake.edu.cn/bioconductor")
BiocManager::install("org.Hs.eg.db")

# 想长期生效,把上面那行 options(...) 写进 ~/.Rprofile

两个顺手的小设置:BiocManager::install() 加上 update = FALSE, ask = FALSE,可以避免它在交互提问上卡住;install.packages() 的 CRAN 镜像可以在 RStudio 里图形化选择,也可以用 options(repos = ...) 写定。

镜像状态会变。我们验证时(2026-09)的情况是:清华的 Bioconductor 镜像对脚本请求返回 403,中科大 / 阿里 / 南大 / 北大等几个镜像的对应路径是 404,西湖大学的镜像可用且最快。装不动就换一个再试。

三、Python 与 Biopython

分子对接的输入准备、批量文件处理、机器学习建模、调 API 拉数据,基本都是 Python 的活。

名称链接说明
Python 官网下载python.org建议走 conda 环境装,不要直接改系统 Python
Biopython 官方教程biopython.org序列读写、翻译、比对、调 NCBI 全在里面,本身就够当一本教材
Biopython Cookbookbiopython.org官方实用片段集,建议动手敲一遍

四、编辑器

名称链接说明
VS Codecode.visualstudio.com通用性强,远程连服务器写代码很方便,配 Python / R 插件即可
RStudio Desktopposit.co只写 R 的话体验最好
PyMOLpymol.org看蛋白结构与对接结果(有开源版可用)

五、装完自己验一遍

别等到跑流程才发现某个工具没装上。下面几条命令逐个敲一遍,都能出结果就说明环境没问题。

bash
conda --version        # conda 是否可用
conda env list         # 看当前有哪些环境
python -V              # Python 版本
R --version            # R 版本
vina --version         # 装了对接环境后检查
fastp --version        # 装了 RNA-seq 环境后检查
samtools --version | head -1
hisat2 --version | head -1

六、装依赖最常遇到的几类报错

现象原因与处理
Solving environment 卡很久或解不出来依赖冲突。换 mamba / micromamba 解,或者降低包的数量、放宽版本号。
PackagesNotFoundError渠道没配对。生信软件要加 -c conda-forge -c bioconda,顺序不能反。
网络超时、下载极慢换个网络环境或配置国内镜像源;公司或校园网如果做了限制,也可能需要代理。
装完 command not found环境没激活。先 conda activate 环境名,再用 which 命令 确认路径。
R 包在系统 R 里装不上编译依赖缺失(如 libxml2、libcurl 开发包),建议直接用 conda 建带 R 的环境,省去编译麻烦。
一个提醒

环境装好后,把 conda list > env_locked.txt 和 R 的 sessionInfo() 一起保存下来。写论文方法学部分时要写清版本号,半年后自己复现也靠它。