Cytoscape 基础教程笔记
Cytoscape 基础教程笔记
Cytoscape 是一款开源的生物网络可视化和分析软件,广泛应用于蛋白质相互作用网络、基因调控网络等生物信息学数据的展示与分析。以下是根据官方基础教程整理的八课笔记。
第一课:新手上路
Cytoscape 可本地安装,也可通过 Web Start 运行,需要 Java 环境(JRE)。启动后需要下载样例文件:
.sif文件:蛋白质相互作用网络信息,蛋白以数字 ID 区分.na文件:各数字 ID 的注释信息(如基因名)
导入方式:
- 网络:
File → Import → Network或Ctrl+L - 节点属性:
File → Import → Node Attributes
导入后,圆圈代表节点(node),连线代表相互作用(edge)。选中节点后可通过 Select → Nodes → First neighbors of selected nodes 选中直接相互作用蛋白,再用 File → New → Network → From selected nodes, all edges 提取子网络。
布局与样式:
Layout菜单提供多种网络组织方式VizMapper可定制节点形状、大小、颜色,连线粗细等- 样式设置后务必点击
Apply
Cytoscape 也支持从网络直接导入相互作用数据:File → Import → Network 选择 remote 并输入 URL。
第二课:筛选和编辑
筛选(Filter)
- 拖放或
Shift多选节点和连线 Select → Use Filters,在 Filters 面板中Options → Create new filter- 定义筛选条件,如
edge.interaction,在 Advanced 中输入non_core或core等类型 - 点击
Apply
筛选后可选中特定类型的相互作用,用 Edit → Delete Selected Nodes/Edges 删除。
查找孤立节点
将筛选条件设为 *,选中所有有相互作用的节点,用 New → Network → From selected nodes, selected edges 提取。再用 Layout → spring-embedded layout 重新排列。
编辑网络
在控制面板的 Editor 标签中:
- 点击 “Add a Node” 添加节点,拖到画布中
- 点击 “Directed Edge” 添加有向连线
- 属性在数据面板的
Node Attribute Browser和Edge Attribute Browser中查看和修改 Del键删除选中项
第三课:获取外部数据
常用数据库
| 数据库 | 说明 | 网址 |
|---|---|---|
| SGD | 酵母基因组数据库 | db.yeastgenome.org |
| BIND/BOND | 生物分子相互作用网络 | bond.unleashedinformatics.com |
| Pathway Commons | 整合多种通路数据库 | pathwaycommons.org |
| Pathguide | 生物信息学数据库目录 | pathguide.org |
数据下载
- SGD:指定要下载的内容,重定向到新页面后另存为
- BIND:注册免费账号,搜索目标分子,在
interactions结果右上角导出为.sif格式 - Pathway Commons:直接搜索并导入
数据融合
下载多个源的相互作用网络后,可用 Graph Merge 插件(或 Plugins → Advanced Network Merge)融合成一张图。
第四课:表达分析
数据格式
表达数据文件(如 .mrna)格式:
- 第一行:数据标签
- 第一栏:节点名称(必须与
.sif文件中一致) - 第二栏:基因座名
- 后续各栏:表达信息
- 各栏之间用空白符分隔
导入与可视化
- 导入
.sif网络文件 Import → Attribute/Expression Matrix(Ctrl+E)导入表达数据- 在
VizMapper中新建显示风格 - 双击
Node color,选择continuous mapping - 设置颜色阈值(如表达量高为红色,低为绿色)
- 点击
Apply
案例分析
以酵母 Gal 转录因子(Gal1、Gal4、Gal80)为例:
- 先用 Filter 去除
pp(protein-protein)相互作用 - 用
yFiles Organic layout查看剩余连线 - 选择强烈诱导或抑制的节点及其邻居
- 复制到新网络中分析转录因子对不同蛋白表达量的影响
第五课:Agilent Literature Search 插件
ALS 插件可从文献中自动构建相互作用网络。
安装与使用
- 下载
.jar放到plugins文件夹,重启 Cytoscape Plugins → Agilent Literature Search- 设置搜索关键词、种属、每页显示论文数
- 点击蓝色三角开始搜索
结果验证
选中连线 → 右键 Evidence from Literature:
Show Sentences from the Literature:查看支持该相互作用的文献句子Gather Evidence from the Literature:收集证据Extend Network from the Literature:扩展网络
不靠谱的句子可右键 Delete Sentence 删除,对应的连线会自动消失。
搜索优化
Interaction Lexicon:limited:仅包含激活、甲基化、切割等高置信度动词relaxed:范围放宽,包含加入、提高、诱导等
Use Aliases:使用蛋白别名(如 p53 = p53 OR trp53 OR tp53)Context:指定主题(如 cancer、阿尔茨海默症)- 高级搜索语法:
(P53) AND Cancer AND (Science[ta] OR Nature[ta])
第六课:GO 分析
使用 BiNGO 插件进行 GO term 富集分析。
导入 GO 信息
File → Import → Ontology and Annotation,设置 annotation 和 ontology 类型后导入。
BiNGO 设置
- 选中目标节点及其邻居(
Ctrl+F搜索 →Ctrl+6选邻居 →Ctrl+N新建子网络) Ctrl+Alt+A全选子网络节点Plugins → BiNGO- 参数设置:
- 统计检验:
Hypergeometric(数据量大时用Binomial) - 多重检验校正:
Benjamini & Hochberg FDR - 显著性水平:
0.05 - 可视化类别:
Overrepresented categories after correction - 参考集:
Test cluster versus complete annotation - Ontology:
GO_Biological_Process - 选择物种
- 统计检验:
- 勾选
Save BiNGO Data file,点击Start BiNGO
结果解读
- 节点颜色:富集程度越高越偏橙色,越低越偏黄色,白色表示未显著富集
- 属性浏览器中新增:
description_test:GO termadjustedPValue_test:校正后的 p 值n_test:该 GO term 下的节点数x_test:所选节点中该 GO term 下的节点数
第七课:模块和复合物
MCODE 找复合物
原理:内部连线多的节点更可能是复合物成员。
Plugins → MCODE → Start MCODE- 点击
Analyze(或Advanced Options修改参数) - 结果中分数较高(>1)且节点数合理的复合物可信度较高
- 用 BiNGO 考察子网络的 GO 富集情况作为间接证据
jActiveModules
利用表达数据鉴定活性模块:
- 导入包含 significance 值的表达数据
Plugins → jActiveModules → Active Modules: Set Parameters- 选择表达数据,设置返回结果数
Plugins → jActiveModules → Active Modules: Find Modules
结果窗口中:size 表示子网络节点数,score 表示可信度,红色表示显著。
第八课:整合网络服务
从公共数据库导入
File → Import → Network from Web Services:
- NCBI Entrez:关键词如
pparg AND human[ORGN] - Pathway Commons:输入关键词和物种
- IntAct:输入
PPARG AND species:human,获取直接相互作用蛋白后可用Get neighbours by ID(s)扩展到三跳以内 - WikiPathways:支持 GPML 格式
导入注释
File → Import → Import Attributes from NCBI Entrez GeneFile → Import → Import Attributes from BioMart
数据融合
用 Advanced Network Merge 将多个来源的网络融合,可通过添加属性标记各节点的来源。
ID 映射
Cytoscape 大小写敏感,若 ID 格式不一致(如全小写),可用脚本转换后重新映射。
小结
Cytoscape 的核心流程是:导入网络数据 → 可视化 → 筛选和编辑 → 结合表达数据或文献证据进行分析 → 用插件(BiNGO、MCODE 等)挖掘生物学意义。掌握这八课的基础操作后,可以处理大多数蛋白质相互作用和基因调控网络的分析需求。