工具与环境安装
这一页只解决一件事:把 R、Python 和 conda 环境管理装好,并且以后每换一个项目都能干净隔离。装环境是生信里最容易被跳过、也最容易反复出事的一步。
一、conda:环境管理器(最先装)
不同生信软件依赖不同版本的 Python、R 和编译库,全装在一个环境里必然冲突。正确做法是每个项目一个独立环境。conda 就是干这个的;嫌它慢的话,装 mamba 或 micromamba 替代。
| 名称 | 链接 | 说明 |
|---|---|---|
| Miniconda | docs.conda.io | 官方推荐的最小安装版,比完整版 Anaconda 干净得多 |
| mamba | mamba.readthedocs.io | conda 的 C++ 重写版,解依赖快很多,命令基本兼容 |
| conda 官方中文文档 · 环境管理 | docs.conda.org.cn | 创建、激活、导出、删除环境的标准操作 |
| Bioconda | bioconda.github.io | 生信软件的 conda 频道,3000+ 软件一条命令装好 |
核心命令(建议先复制跑一遍)
# 装好 Miniconda 后,先给 base 环境装上 mamba(更快)
conda install -n base -c conda-forge mamba
# 为某个项目建独立环境
mamba create -n docking python=3.11
mamba activate docking
# 一次装齐相关软件(不要一个个装,容易依赖冲突)
mamba install -c conda-forge -c bioconda autodock-vina openbabel rdkit
# 导出环境,方便别人复现你的结果
mamba env export > environment.yml不要在 base 环境里装生信软件。污染之后很难修,最后通常只能整个重装。
二、R 与 RStudio
差异表达(DESeq2、edgeR)、富集分析(clusterProfiler)、统计与作图是 R 的主场,Bioconductor 生态无可替代。
| 名称 | 链接 | 说明 |
|---|---|---|
| R 官网 | r-project.org | 下载 R 本体 |
| CRAN 镜像列表 | cran.r-project.org | 就近选镜像,装包速度快很多 |
| RStudio Desktop | posit.co | R 的集成开发环境,写脚本、看图、看变量都在一个窗口里 |
| Bioconductor | bioconductor.org | R 生信包总库,每个包都有 vignette,最权威的教程来源 |
# 装 Bioconductor 包的标准姿势
if (!requireNamespace("BiocManager", quietly = TRUE))
install.packages("BiocManager")
BiocManager::install(c("DESeq2", "clusterProfiler", "org.Hs.eg.db", "enrichplot"))
install.packages(c("ggplot2", "pheatmap", "apeglm"))R 不必一开始就精通。先掌握「读入数据 → 整理 → 画图 → 跑统计」这条线,够支撑后面的分析;深度美化可以晚点再说。
官方源太慢时,换国内镜像
Bioconductor 的包动辄几十到几百 MB。我们在云主机上实测过:从官方源直连只有 5 KB/s 左右,一个 org.Hs.eg.db 要拖几个小时;换成国内镜像后同一批包跑到 20 MB/s 以上,几十秒装完。这一步不换源,很多人会卡在这里以为是自己网坏了。
# 临时用一次
options(BioC_mirror = "https://mirrors.westlake.edu.cn/bioconductor")
BiocManager::install("org.Hs.eg.db")
# 想长期生效,把上面那行 options(...) 写进 ~/.Rprofile两个顺手的小设置:BiocManager::install() 加上 update = FALSE, ask = FALSE,可以避免它在交互提问上卡住;install.packages() 的 CRAN 镜像可以在 RStudio 里图形化选择,也可以用 options(repos = ...) 写定。
镜像状态会变。我们验证时(2026-09)的情况是:清华的 Bioconductor 镜像对脚本请求返回 403,中科大 / 阿里 / 南大 / 北大等几个镜像的对应路径是 404,西湖大学的镜像可用且最快。装不动就换一个再试。
三、Python 与 Biopython
分子对接的输入准备、批量文件处理、机器学习建模、调 API 拉数据,基本都是 Python 的活。
| 名称 | 链接 | 说明 |
|---|---|---|
| Python 官网下载 | python.org | 建议走 conda 环境装,不要直接改系统 Python |
| Biopython 官方教程 | biopython.org | 序列读写、翻译、比对、调 NCBI 全在里面,本身就够当一本教材 |
| Biopython Cookbook | biopython.org | 官方实用片段集,建议动手敲一遍 |
四、编辑器
| 名称 | 链接 | 说明 |
|---|---|---|
| VS Code | code.visualstudio.com | 通用性强,远程连服务器写代码很方便,配 Python / R 插件即可 |
| RStudio Desktop | posit.co | 只写 R 的话体验最好 |
| PyMOL | pymol.org | 看蛋白结构与对接结果(有开源版可用) |
五、装完自己验一遍
别等到跑流程才发现某个工具没装上。下面几条命令逐个敲一遍,都能出结果就说明环境没问题。
conda --version # conda 是否可用
conda env list # 看当前有哪些环境
python -V # Python 版本
R --version # R 版本
vina --version # 装了对接环境后检查
fastp --version # 装了 RNA-seq 环境后检查
samtools --version | head -1
hisat2 --version | head -1六、装依赖最常遇到的几类报错
| 现象 | 原因与处理 |
|---|---|
Solving environment 卡很久或解不出来 | 依赖冲突。换 mamba / micromamba 解,或者降低包的数量、放宽版本号。 |
PackagesNotFoundError | 渠道没配对。生信软件要加 -c conda-forge -c bioconda,顺序不能反。 |
| 网络超时、下载极慢 | 换个网络环境或配置国内镜像源;公司或校园网如果做了限制,也可能需要代理。 |
装完 command not found | 环境没激活。先 conda activate 环境名,再用 which 命令 确认路径。 |
| R 包在系统 R 里装不上 | 编译依赖缺失(如 libxml2、libcurl 开发包),建议直接用 conda 建带 R 的环境,省去编译麻烦。 |
环境装好后,把 conda list > env_locked.txt 和 R 的 sessionInfo() 一起保存下来。写论文方法学部分时要写清版本号,半年后自己复现也靠它。