使用Transformers进行图分类-6ren

使用Transformers进行图分类

转载作者：我是一只小鸟更新时间：2023-04-18 22:31:12

37

4

在之前的博文中，我们探讨了图机器学习的一些理论知识。这一篇我们将探索如何使用 Transformers 库进行图分类。(你也可以从此处下载演示 notebook，跟着一起做！) 。

目前，Transformers 中唯一可用的图 transformer 模型是微软的 Graphormer ，因此本文的例子将会基于该模型。我们期待看到大家会使用并集成哪些其他模型进 🤗.

软件

要学习本教程，需要安装 datasets 和 transformers (版本号 >= 4.27.2)，你可以使用 pip install -U datasets transformers 来安装.

数据

你可以使用自己的图数据集，也可以使用 Hub 上已有的数据集。本文我们主要使用已有的数据集，你也可以随时添加你的数据集到 Hugging Face！。

数据加载

从 Hub 加载图数据集非常简单。这里，我们加载 OGB 库中的 ogbg-mohiv 数据集 (该数据集是斯坦福开放图基准 (Open Graph Benchmark，OGB) 的一部分)

                        
                          from datasets import load_dataset

# There is only one split on the hub
dataset = load_dataset("OGB/ogbg-molhiv")

dataset = dataset.shuffle(seed=0)

这个数据集含三个拆分， train 、 validation 和 test ，所有这些拆分每一行都表示一个图，每个图包含 5 个数据列 ( edge_index 、 edge_attr 、 y 、 num_nodes 、 node_feat )，你可以通过执行 print(dataset) 来查看.

如果你还安装了其他图处理库，你还可以用这些库把图可视化出来，并进一步检查数据集。例如，使用 PyGeometric 和 matplotlib

                        
                          import networkx as nx
import matplotlib.pyplot as plt

# We want to plot the first train graph
graph = dataset["train"][0]

edges = graph["edge_index"]
num_edges = len(edges[0])
num_nodes = graph["num_nodes"]

# Conversion to networkx format
G = nx.Graph()
G.add_nodes_from(range(num_nodes))
G.add_edges_from([(edges[0][i], edges[1][i]) for i in range(num_edges)])

# Plot
nx.draw(G)

格式

在 Hub 上，图数据集主要存储为图列表形式 (使用 jsonl 格式).

单个图表示为一个字典，以下是我们图分类数据集的理想格式

edge_index 包含图上每条边对应的节点 ID，存储为包含两个节点列表的列表 (即由一个源节点列表和一个目的节点列表组成的列表).
- 类型 : 2 个整数列表的列表。
- 示例 : 包含四个节点 (0、1、2 和 3) 且连接为 1->2、1->3 和 3->1 的图将具有 edge_index = [[1, 1, 3]、[2、3、1]] 。你可能会注意到此处不存在节点 0，因为在本数据中它与其他节点无边连接。这就是下一个属性很重要的原因。
num_nodes 表示图中可用节点的数目 (默认情况下，假定节点按顺序编号).
- 类型 : 整数
- 示例 : 在上例中， num_nodes = 4 。
y 每个图的预测标签 (可以是类、属性值或是不同任务的多个二分类标签).
- Type : 整数列表 (用于多分类) 、浮点数 (用于回归) 或 0/1 列表 (用于二元多任务分类)
- 示例 : 我们可以预测图规模 (小 = 0，中 = 1，大 = 2)。本例中， y = [0] 。
node_feat 包含图中每个节点的可用特征 (如果存在)，按节点 ID 排序.
- 类型 : 整数列表的列表 (可选)
- 例子 : 如上例中的节点可以有一些类型特征 (就像分子图中的节点是不同的原子，不同的原子有不同的类型一样)。打比方，本例中 node_feat = [[1], [0], [1], [1]] 。
edge_attr 包含图中每条边的可用属性 (如果存在)，按 edge_index 排序.
- 类型 : 整数列表的列表 (可选)
- 例子 : 仍使用上例，边也可以有类型 (如分子中的键)，如 edge_attr = [[0], [1], [1]]`。

预处理

图 transformer 框架通常需要根据数据集进行特定的预处理，以生成有助于目标学习任务 (在我们的案例中为分类) 的特征和属性。在这里，我们使用 Graphormer 的默认预处理，它生成进度/出度信息、节点间的最短路径以及模型感兴趣的其他属性.

                        
                          from transformers.models.graphormer.collating_graphormer import preprocess_item, GraphormerDataCollator

dataset_processed = dataset.map(preprocess_item, batched=False)

我们也可以在 DataCollator 的参数中动态进行预处理 (通过将 on_the_fly_processing 设置为 True)。但并非所有数据集都像 ogbg-molhiv 那样小，对于大图，动态预处理成本太高，因此需要预先进行预处理，并存储预处理后的数据供后续训练实验使用.

模型

模型加载

这里，我们加载一个已有的预训练模型及其 checkpoint 并在我们的下游任务上对其进行微调，该任务是一个二分类任务 (因此 num_classes = 2 )。我们还可以在回归任务 ( num_classes = 1 ) 或多任务分类上微调我们的模型.

                        
                          from transformers import GraphormerForGraphClassification

model = GraphormerForGraphClassification.from_pretrained(
    "clefourrier/pcqm4mv2_graphormer_base",
    num_classes=2, # num_classes for the downstream task
    ignore_mismatched_sizes=True,
)

我们来看下细节.

在代码中调用 from_pretrained 方法来下载并缓存模型权重。由于类的数量 (用于预测) 取决于数据集，我们将新的 num_classes 和 ignore_mismatched_sizes 与 model_checkpoint 一起传给该函数。这会触发函数创建一个自定义的、特定于该下游任务的分类头，这个头与原模型中的解码器头很可能是不同的.

我们也可以创建一个新的随机初始化的模型来从头开始训练，此时，我们既可以复用给定检查点的超参配置，也可以自己手动选择超参配置.

训练或微调

为了简化模型训练，我们使用 Trainer 。我们需要定义训练相关的配置以及评估指标来实例化 Trainer 。我们主要使用 TrainingArguments 类，这是一个包含所有配置项的类，用于定制训练配置。我们要给它一个文件夹名称，用于保存模型的 checkpoint.

                        
                          from transformers import TrainingArguments, Trainer

training_args = TrainingArguments(
    "graph-classification",
    logging_dir="graph-classification",
    per_device_train_batch_size=64,
    per_device_eval_batch_size=64,
    auto_find_batch_size=True, # batch size can be changed automatically to prevent OOMs
    gradient_accumulation_steps=10,
    dataloader_num_workers=4, #1,
    num_train_epochs=20,
    evaluation_strategy="epoch",
    logging_strategy="epoch",
    push_to_hub=False,
)

对于图数据集，调整 batch size 和梯度累积步数来保证有效 batch size 够大同时又要避免内存不足，这件事尤为重要.

最后一个参数 push_to_hub 允许 Trainer 在训练期间定期将模型推送到 Hub，这个通常由保存步长来决定.

                        
                          trainer = Trainer(
    model=model,
    args=training_args,
    train_dataset=dataset_processed["train"],
    eval_dataset=dataset_processed["validation"],
    data_collator=GraphormerDataCollator(),
)

在用于图分类的 Trainer 中，对给定的图数据集使用正确的数据整理器 (data collator) 很重要，这个数据整理器会将图转换为用于训练的 batch 数据.

                        
                          train_results = trainer.train()
trainer.push_to_hub()

训练完后，可以使用 push_to_hub 将模型与所有其他训练相关信息一起保存到 hub.

由于此模型比较大，因此在 CPU (Intel Core i7) 上训练/微调 20 个 epoch 大约需要一天时间。想要更快点的话，你可以使用强大的 GPU 和并行化方法，你只需在 Colab notebook 中或直接在你选择的其他集群上启动代码即可.

结束语

现在你已经知道如何使用 transformers 来训练图分类模型，我们希望你尝试在 Hub 上分享你最喜欢的图 transformer 模型的 checkpoints、模型以及数据集，以供社区的其他人使用！。

英文原文: https://hf.co/blog/graphml-classification 。

作者: Clém 译者: Matrix Yao (姚伟峰)，英特尔深度学习工程师，工作方向为 transformer-family 模型在各模态数据上的应用及大规模模型的训练推理.

排版/审校: zhongdongy (阿东) 。

最后此篇关于使用Transformers进行图分类的文章就讲到这里了,如果你想了解更多关于使用Transformers进行图分类的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

37

4

0

文章推荐：我的第一个项目(十一):飞机大战分包完成(简单阐述分包思路以及过程)

文章推荐：园子的现代化建设-新功能：发布合集预览版

文章推荐： Springboot整合Flowable6.x导出bpmn20

文章推荐： Django笔记二十四之数据库函数之比较和转换函数

javascript - 使用 WebScriptEndpoint 使用 javascript 使用 WCF 服务
我在网上搜索但没有找到任何合适的文章解释如何使用 javascript 使用 WCF 服务，尤其是 WebScriptEndpoint。任何人都可以对此给出任何指导吗？谢谢最佳答案这是一篇关于
c - 没有结果!!使用 fork() 使用 dup2 使用 2 个管道运行 execlp()
我正在编写一个将运行 Linux 命令的 C 程序，例如: cat/etc/passwd | grep 列表 |剪切-c 1-5 我没有任何结果 *这里 parent 等待第一个 child (chi
python - 处理文件上传，使用 Pillow 调整大小，使用 SQLAlchemy 存储，使用 Flask 提供文件
所以我正在尝试处理文件上传，然后将该文件作为二进制文件存储到数据库中。在我存储它之后，我尝试在给定的 URL 上提供文件。我似乎找不到适合这里的方法。我需要使用数据库，因为我使用 Google 应用引
excel - 使用 IF 使用 VBA 在单元格中添加公式的问题
我正在尝试制作一个宏，将下面的公式添加到单元格中，然后将其拖到整个列中并在 H 列中复制相同的公式我想在 F 和 H 列中输入公式的数据 Range("F1").formula = "=IF(ISE
使用 OperatorPrecedenceParser 使用 FParsec 解析函数应用程序？
问题类似于this one ，但我想使用 OperatorPrecedenceParser 解析带有函数应用程序的表达式在 FParsec . 这是我的 AST: type Expression =
sql - 使用 sequelize 使用 where 查询编码计数
我想通过使用 sequelize 和 node.js 将这个查询更改为代码取决于在哪里 select COUNT(gender) as genderCount from customers where
bash - 使用 “let”分配Bash失败，使用 “/”
我正在使用GNU bash，版本5.0.3(1)-发行版(x86_64-pc-linux-gnu)，我想知道为什么简单的赋值语句会出现语法错误: #/bin/bash var1=/tmp
javascript - 使用 JavaScript 使用 FOR OF 数组循环时出现错误？
这里，为什么我的代码在 IE 中不起作用。我的代码适用于所有浏览器。没有问题。但是当我在 IE 上运行我的项目时，它发现错误。而且我的 jquery 类和 insertadjacentHTMl 也不
javascript - 使用 javascript 使用 for 属性更改表单标签内容
我正在尝试更改标签的innerHTML。我无权访问该表单，因此无法编辑 HTML。标签具有的唯一标识符是“for”属性。这是输入和标签的结构:
javascript - 使用 jquery 使用 .on() 将事件附加到页面上的动态插入按钮
我有一个页面，我可以在其中返回用户帖子，可以使用一些 jquery 代码对这些帖子进行即时评论，在发布新评论后，我在帖子下插入新评论以及删除按钮。问题是 Delete 按钮在新插入的元素上不起作用，
使用 awk 使用 sha1sum 进行散列
我有一个大约有 20 列的“管道分隔”文件。我只想使用 sha1sum 散列第一列，它是一个数字，如帐号，并按原样返回其余列。使用 awk 或 sed 执行此操作的最佳方法是什么？ Accounti
mysql - 使用 insert into 使用 mysql
我需要将以下内容插入到我的表中...我的用户表有五列 id、用户名、密码、名称、条目。 (我还没有提交任何东西到条目中，我稍后会使用 php 来做)但由于某种原因我不断收到这个错误:#1054 - U
jquery - 将输入字段值修剪为仅字母数字字符/使用 .使用 jQuery
所以我试图有一个输入字段，我可以在其中输入任何字符，但然后将输入的值小写，删除任何非字母数字字符，留下“。”而不是空格。例如，如果我输入: 地球的 70% 是水，-!*#$^^ & 30% 土地输
javascript - 使用 .innerHTML 使用 DOM
我正在尝试做一些我认为非常简单的事情，但出于某种原因我没有得到想要的结果？我是 javascript 的新手，但对 java 有经验，所以我相信我没有使用某种正确的规则。这是一个获取输入值、检查选择
php - 使用 angularjs 使用 where 子句从数据库获取数据
我想使用 angularjs 从 mysql 数据库加载数据。这就是应用程序的工作原理；用户登录，他们的用户名存储在 cookie 中。该用户名显示在主页上我想获取这个值并通过 angularjs
ios - 使用 UITableViewCell 使用 AutoLayout
我正在使用 autoLayout，我想在 UITableViewCell 上放置一个 UIlabel，它应该始终位于单元格的右侧和右侧的中心。这就是我想要实现的目标所以在这里你可以看到我正在谈论的
mysql - 使用 ElasticSearch 使用 or 和运算符搜索多个字段
我需要与 MySql 等效的 elasticsearch 查询。我的 sql 查询: SELECT DISTINCT t.product_id AS id FROM tbl_sup_price t
ios - 使用 Swift 使用 JSON
我正在实现代码以使用 JSON。 func setup() { if let flickrURL = NSURL(string: "https://api.flickr.com/
javascript - 使用 JavaScript 使用 for 循环声明变量
我尝试使用for循环声明变量，然后测试cols和rols是否相同。如果是，它将运行递归函数。但是，我在 javascript 中执行 do 时遇到问题。有人可以帮忙吗？现在，在比较 col.1 和
jquery - 使用 :after 使用 jquery 更改样式
我举了一个我正在处理的问题的简短示例。 HTML代码: 1 2 3 CSS 代码: .BB a:hover{ color: #000; } .BB > li:after {

首页

博学

6Ren·AI

商城