生信入门实战 分子对接 · 组学分析 · 跑通为准
总览 / 代码验证

代码验证报告

这个站点收录的每一个脚本,都在真实环境里跑过一遍才放上来。目标是:你复制命令就能出结果,而不是先花两天调环境、最后发现模板本身是错的。

为什么要单独做这一页

教程类内容最容易出的问题不是「写得不好」,而是「根本没跑过」——路径写错、依赖版本冲突、参数早就变了,读者照着做只会卡住,还以为是自己的问题。所以这里把验证过程完整摊开:环境怎么建的、命令是什么、输出长什么样、哪里出过问题。

验证环境

  • 运行环境:Ubuntu 云主机,8 核 / 15 GB 内存 / 38 GB 可用磁盘,无 Docker
  • 环境管理:micromamba 2.9.0(每个模块一个独立环境,不污染 base)
  • 软件来源:conda-forge + bioconda,少数包走 pip
  • 验证方式:端到端真跑:公开真实数据、完整命令、真实输出,跑不通的部分如实标注

逐脚本验证结果

vs_batch.py已实测跑通分子对接与虚拟筛选

1IEP(c-Abl 激酶 + 伊马替尼)体系上批量对接 5 个配体,全部跑通,产出 poses/ 与 results.csv。阳性对照伊马替尼重对接得 −13.27 kcal/mol,top pose 与共晶结构 RMSD 0.270 Å(Vina 官方示例 0.283 Å),重对接成功。

  • 实测环境:Python 3.11.16 + vina 1.2.7 + meeko 0.8.0 + rdkit 2026.03.1 + openbabel 3.2.1,全部版本号见日志
  • 实测耗时:单配体冒烟测试 24 s;5 配体批量(exhaustiveness=16)2 min 27 s
  • 跑出 2 个真实缺陷并已修复:一是不同目录下的同名配体会互相覆盖输出(并发写同名文件),二是输入文件或 vina 路径不存在时不报错、静默失败
  • 修复前的原文件另存为 verify/docking/vs_batch.orig.py,逐行改动见 diff
  • 脚本本体只依赖 Python 标准库 + vina 可执行文件;准备 PDBQT 输入才需要 meeko / rdkit / molscrub

查看完整运行日志 →

requirements.txt已按实测环境核对分子对接与虚拟筛选

依赖清单在真实环境里逐条装过。已补上 molscrub 漏声明的 joblib——照原清单安装,跑 scrub.py 会直接 ModuleNotFoundError。

  • conda 装:numpy / scipy / rdkit / vina / meeko / gemmi / openbabel / prody
  • pip 装:molscrub、joblib
  • 实测版本号见 verify/docking/env_versions.txt

查看完整运行日志 →

README.md安装步骤已实测分子对接与虚拟筛选

文档里的建环境、装依赖、准备受体配体、跑批量的命令逐条执行过;其中 pip 安装清单按实测补了 joblib。

  • 按 README 走一遍能装出可用环境(踩坑与修正见日志第 5 节)

查看完整运行日志 →

怎么理解这些结论

  • 已实测跑通:脚本在真实输入上完整跑过,产出可核查的结果文件。
  • 部分验证:主流程跑通,但某个可选分支(例如需要联网或额外数据的部分)没跑到,页面里会写明。
  • 未标注:尚未复跑,不代表有问题,但请以自己环境为准。

即使标了「已实测跑通」,也请注意:脚本用的是示例数据,换到你的体系时路径、分组名、参考文件版本都要按 README 改。跑不通先看日志末尾的报错,再对照模块页里的「常见坑」。

外部链接复检

页面里指向站外资源的链接,都用 build/check_links.py 逐条真实请求核对过一遍,不是凭印象写上去的。复检时间 2026-09-23,共 171 条,正常响应 158 条。

下面这些站点会拒绝脚本发起的自动请求(403 / 405 / 429),用浏览器正常打开没问题,属于「存在但挡爬虫」:

  • 403 http://www.clustal.org/omega/
  • 403 https://gatk.broadinstitute.org/hc/en-us
  • 403 https://go.drugbank.com/
  • 403 https://sourceforge.net/projects/smina/
  • 403 https://www.biostars.org/
  • 405 https://www.encodeproject.org/

这几条脚本连不上,但已逐条用浏览器复核过:站点本身都能打开,只是对脚本请求响应超时或限流。链接保留,点开正常。(确有失效的——原「生信技能树」旧博客域名当时已解析不了——已从正文换成可用的同类资源。)

  • 000 https://biit.cs.ut.ee/gprofiler/gost
  • 000 https://mafft.cbrc.jp/alignment/software/
  • 000 https://www.10xgenomics.com/datasets
  • 000 https://www.10xgenomics.com/support/software/cell-ranger/downloads
  • 000 https://www.blopig.com/blog/2022/05/mmpb-gbsa-a-quick-start-guide/
  • 000 https://www.kegg.jp/
  • 000 https://www.mdtutorials.com/gmx/

查看全部链接的逐条检出结果 →