返回模型
说明文档
BigBird 基础模型
BigBird 是一种基于稀疏注意力的 Transformer 模型,它将基于 Transformer 的模型(如 BERT)扩展到更长的序列。此外,BigBird 还从理论上解释了稀疏模型可以处理完整 Transformer 的能力。
这是一个使用掩码语言建模(MLM)目标在英语语言上预训练的模型。它在这篇论文中被提出,并首次在这个仓库中发布。
模型描述
BigBird 依赖于块稀疏注意力而非普通注意力(即 BERT 的注意力),并且可以处理长度达 4096 的序列,而计算成本远低于 BERT。它在涉及超长序列的各种任务上取得了最先进(SOTA)的成绩,例如长文档摘要、长上下文问答。
原始实现
点击此链接查看原始实现。
如何使用
通过 git clone https://huggingface.co/OWG/bigbird-roberta-base 克隆仓库来下载模型。
然后你可以使用以下代码来使用该模型:
from onnxruntime import InferenceSession, SessionOptions, GraphOptimizationLevel
from transformers import BertTokenizer
tokenizer = BertTokenizer.from_pretrained("google/bigbird-roberta-base")
options = SessionOptions()
options.graph_optimization_level = GraphOptimizationLevel.ORT_ENABLE_ALL
session = InferenceSession("path/to/model.onnx", sess_options=options)
session.disable_fallback()
text = "Replace me by any text you want to encode."
input_ids = tokenizer(text, return_tensors="pt", return_attention_mask=True)
inputs = {k: v.cpu().detach().numpy() for k, v in input_ids.items()}
outputs_name = session.get_outputs()[0].name
outputs = session.run(output_names=[outputs_name], input_feed=inputs)
OWG/bigbird-roberta-base
作者 OWG
↓ 0
♥ 0
创建时间: 2022-04-22 10:29:31+00:00
更新时间: 2024-04-12 06:59:37+00:00
在 Hugging Face 上查看文件 (3)
.gitattributes
README.md
model/model.onnx
ONNX