ONNX 模型库
返回模型

说明文档


license: mit tags:

  • ONNX
  • DML
  • ONNXRuntime
  • phi3
  • custom_code

Phi-3.5 Vision Instruct ONNX 模型

<!-- 提供模型功能/用途的快速摘要。 --> 本仓库托管了 Phi-3.5-vision-instruct 的优化版本,用于通过 ONNX Runtime 在您的 CPU 和 GPU 上加速推理。

Phi-3.5 Vision 是一个轻量级的、最先进的开放多模态模型,基于包含合成数据和经过筛选的公开网络数据集构建,专注于文本和视觉方面高质量、推理密集的数据。该模型属于 Phi-3.5 模型家族,多模态版本支持高达 128K 上下文长度(以 token 计)。基础模型经过了严格的增强过程,结合了监督微调和直接偏好优化,以确保精确的指令遵循和可靠的安全措施。

Phi-3.5 Vision 模型的优化变体以 ONNX 格式发布,可在 CPU 和 GPU 上通过 ONNX Runtime 运行,支持服务器平台、Windows、Linux 和 Mac 桌面以及移动 CPU 等多种设备,并为每个目标平台提供最适合的精度。

ONNX 模型

以下是我们添加的一些优化配置:

  1. INT4 CPU ONNX 模型:通过 RTN 进行 int4 量化的 CPU 模型。
  2. INT4 GPU ONNX 模型:通过 RTN 进行 int4 量化的 GPU 模型。

如何开始使用该模型

为了在各种设备、平台和 EP 后端上支持 Phi-3.5 模型,我们引入了一个新的 API 来封装生成式 AI 推理的多个方面。该 API 使您能够轻松地将 LLM 拖放到您的应用程序中。要使用 ONNX 运行这些模型的早期版本,请按照此处的步骤操作。

支持的硬件

该模型已在以下环境测试:

  • Intel(R) Core(TM) i9-10920X CPU @ 3.50GHz
  • 1 块 A100 GPU,SKU: Standard_ND96amsr_A100_v4 (CUDA)
  • GPU SKU: RTX 4080 (DirectML)

最低配置要求:

  • 配备 16GB RAM 的 CPU 机器
  • CUDA:计算能力 >= 7.0 的 NVIDIA GPU
  • Windows:支持 DirectX 12 的 GPU 以及至少 10GB 的组合内存

模型描述

  • 开发者: Microsoft
  • 模型类型: ONNX
  • 编程语言: Python, C, C++
  • 许可证: MIT
  • 模型描述: 这是用于 ONNX Runtime 推理的 Phi-3.5 Vision Instruct 模型的转换版本。
  • 免责声明: 此模型仅为基础模型的优化版本。与模型相关的任何风险由模型使用者承担。请针对您的场景进行验证和测试。应用优化后,输出可能与基础模型略有不同。我们进行了负责任的 AI 评估,未观察到与基础模型相比有显著退化。

更多详情

性能指标

ONNX 视觉模型在 token 生成期间的性能与 Phi-3.5-mini-instruct-onnx 相似。

基础模型使用和注意事项

有关基础模型的详情和 RAI(负责任 AI)注意事项,请参阅此处。

请注意,ONNX 模型的输出可能与基础模型略有不同。用户有责任针对其场景验证输出,并自行承担使用责任。

附录

模型卡片联系方式

parinitarahi, kvaishnavi, natke, yunl, sunghcho

贡献者

Kunal Vaishnavi, Sunghoon Choi, Yufeng Li, Baiju Meswani, Sheetal Arun Kadam, Rui Ren, Natalie Kershaw, Parinita Rahi, Patrice Vignola, Xiang Zhang, Chai Chaoweeraprasit, Logan Iyer, Vicente Rivera, Jacques Van Rhyn, Yun Liu

商标

本项目可能包含项目、产品或服务的商标或徽标。Microsoft 商标或徽标的授权使用须遵守并必须遵循 Microsoft 商标与品牌指南。在本项目的修改版本中使用 Microsoft 商标或徽标不得引起混淆或暗示 Microsoft 的赞助。任何第三方商标或徽标的使用受该第三方政策的约束。

FusionQuill/Phi-3.5-vision-instruct-onnx-cpu-dml

作者 FusionQuill

↓ 1 ♥ 0

创建时间: 2024-11-19 13:55:28+00:00

更新时间: 2024-11-19 14:06:41+00:00

在 Hugging Face 上查看

文件 (31)

.gitattributes
LICENSE
README.md
config.json
cpu.zip
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/genai_config.json
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-embedding.onnx ONNX
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-embedding.onnx.data
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-text.onnx ONNX
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-text.onnx.data
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-vision.onnx ONNX
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/phi-3.5-v-instruct-vision.onnx.data
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/processor_config.json
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/special_tokens_map.json
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/tokenizer.json
cpu_and_mobile/cpu-int4-rtn-block-32-acc-level-4/tokenizer_config.json
dml.zip
gpu/gpu-int4-rtn-block-32/genai_config.json
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-embedding.onnx ONNX
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-embedding.onnx.data
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-text.onnx ONNX
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-text.onnx.data
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-vision.onnx ONNX
gpu/gpu-int4-rtn-block-32/phi-3.5-v-instruct-vision.onnx.data
gpu/gpu-int4-rtn-block-32/processor_config.json
gpu/gpu-int4-rtn-block-32/special_tokens_map.json
gpu/gpu-int4-rtn-block-32/tokenizer.json
gpu/gpu-int4-rtn-block-32/tokenizer_config.json
onnx/builder.py
onnx/config.json
onnx/modeling_phi3_v.py