ONNX 模型库
返回模型

说明文档

简介

FlagOS 是与全球领先芯片厂商共同开发的面向大模型的统一异构计算软件栈。基于 FlagScale 等核心技术,配合 vllm-plugin-fl 分布式训练/推理框架、FlagGems 通用算子库、FlagCX 通信库和 FlagTree 统一编译器,FlagRelease 平台利用 FlagOS 软件栈自动生成并发布各种 <芯片 + 开源模型> 的组合。这实现了跨多种芯片的高效、自动化模型迁移,开启了大模型部署与应用的新篇章。

基于此,MiniCPM-o-4.5-zhen-FlagOS 模型使用 FlagOS 软件栈针对 zhenwu 芯片进行了适配,实现了:

一体化部署

  • 开箱即用的推理脚本,预配置软硬件参数
  • 发布 FlagOS 容器镜像,支持数分钟内完成部署

一致性验证

  • 通过基准测试进行严格评估:FlagOS 软件栈的性能和结果与多个公开数据集上的原生技术栈进行对比验证

技术概述

FlagGems

FlagGems 是一个使用 Triton 语言实现的高性能通用算子库。它构建在一组后端无关的内核之上,旨在加速各种硬件平台上的 LLM(大语言模型)训练和推理。

FlagTree

FlagTree 是一个面向多种 AI 芯片的开源统一编译器项目,致力于开发多样化的 AI 芯片编译器及相关工具平台生态系统,从而培育和加强 Triton 上下游生态。目前处于初期阶段,该项目旨在保持与现有适配方案兼容的同时统一代码库,以快速实现单仓库多后端支持。对于上游模型用户,它提供跨多后端的统一编译能力;对于下游芯片厂商,它提供 Triton 生态集成的示例。

FlagScale 和 vllm-plugin-fl

FlagScale 是一个综合性工具包,旨在支持大模型的完整生命周期。它基于多个知名开源项目的优势构建,包括 Megatron-LMvLLM,为大模型的管理和扩展提供稳健的端到端解决方案。 vllm-plugin-fl 是一个基于 FlagOS 统一多芯片后端构建的 vLLM 插件,帮助 flagscale 在 vllm 框架上支持多芯片。

FlagCX

FlagCX 是一个可扩展且自适应的跨芯片通信库。它作为一个平台,让开发者、研究人员和 AI 工程师可以在各种项目上协作,为前沿 AI 解决方案的开发做出贡献,并与全球社区分享他们的工作成果。

FlagEval 评估框架

FlagEval 是 2023 年推出的大模型综合评估系统和开放平台。它旨在建立科学、公平、开放的基准、方法论和工具,帮助研究人员评估模型和训练算法的性能。其主要特点包括:

  • 多维度评估:支持 NLP、CV、音频和多模态领域的 800+ 模型评估,涵盖语言理解和图文生成等 20+ 下游任务。
  • 工业级应用场景:已完成主流大模型的横向评估,为芯片-模型性能验证提供权威基准。

评估结果

在 Zhenwu 上使用 USE_FLAGGEMS=1 与在 Nvidia 上直接启动 vllm 服务器的精度差异。

Metrics(avg@1) 与 Nvidia-CUDA 的差异
CMMMU ↑ 3.50%
MMMU ↑ 1.18%
MMMU_Pro_standard ↑ 0.22%
MM-Vet v2 ↑ 1.33%
OCRBench ↑ 1.00%
CII-Bench ↑ 0.13%
Blink ↑ 2.19%

使用指南

环境配置

项目 版本
FlagGems 版本: 4.2.1rc0
vllm & vllm-plugin-fl 版本: 0.13.0 + vllm_fl 0.0.0

下载 FlagOS 镜像

docker pull baai-cp-registry.cn-wulanchabu.cr.aliyuncs.com/flagos/flagos:vllm-plugin-fl

下载开源模型权重

pip install modelscope
modelscope download --model FlagRelease/MiniCPM-o-4.5-zhenwu-FlagOS --local_dir /share/MiniCPMO45

启动容器

#容器启动
docker run --init --detach --net=host --user 0 --ipc=host \
           -v /share:/share --security-opt=seccomp=unconfined \
           --privileged --ulimit=stack=67108864 --ulimit=memlock=-1 \
           --shm-size=512G --gpus all \
           --name flagos baai-cp-registry.cn-wulanchabu.cr.aliyuncs.com/flagos/flagos:vllm-plugin-fl
docker exec -it flagos bash

使用 vllm 服务和调用 MiniCPM-o-4.5

注意:您可以参考 https://github.com/vllm-project/vllm 了解如何使用 vllm

您可以使用

vllm serve /share/MiniCPMO45 --trust-remote-code

在不使用 FlagOS 的情况下启动服务器,并使用

USE_FLAGGEMS=1 vllm serve /share/MiniCPMO45 --trust-remote-code

使用 FlagOS 启动服务器。

之后,您可以在 0.0.0.0:8000 上使用 vllm 服务器进行任何操作!

参与贡献

我们热烈欢迎全球开发者加入我们:

  1. 提交 Issues 报告问题
  2. 创建 Pull Requests 贡献代码
  3. 完善技术文档
  4. 扩展硬件适配支持

许可证

权重文件来自 OpenBMB 的 MiniCPM-o-4.5,采用 apache2.0 许可证开源 https://www.apache.org/licenses/LICENSE-2.0.txt。

FlagRelease/MiniCPM-o-4.5-zhenwu-FlagOS

作者 FlagRelease

↓ 10 ♥ 0

创建时间: 2026-02-03 08:28:57+00:00

更新时间: 2026-03-09 08:07:23+00:00

在 Hugging Face 上查看

文件 (74)

.gitattributes
.msc
.mv
README.md
__pycache__/audio_utils.cpython-312.pyc
__pycache__/chunk_prefill_generate.cpython-312.pyc
__pycache__/configuration_minicpmo.cpython-312.pyc
__pycache__/configuration_minicpmtts.cpython-312.pyc
__pycache__/modeling_minicpmo.cpython-312.pyc
__pycache__/modeling_navit_siglip.cpython-312.pyc
__pycache__/processing_audio_minicpma.cpython-312.pyc
__pycache__/processing_image_minicpmv.cpython-312.pyc
__pycache__/processing_minicpmo.cpython-312.pyc
__pycache__/processing_streaming_mel.cpython-312.pyc
__pycache__/resampler.cpython-312.pyc
__pycache__/sliding_utils.cpython-312.pyc
__pycache__/tts_streaming_generate.cpython-312.pyc
__pycache__/utils.cpython-312.pyc
added_tokens.json
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/config.json
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/generation_config.json
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/merges.txt
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/model.safetensors
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/tokenizer_config.json
assets/CosyVoice2-0.5B/CosyVoice-BlankEN/vocab.json
assets/CosyVoice2-0.5B/README.md
assets/CosyVoice2-0.5B/asset/dingding.png
assets/CosyVoice2-0.5B/campplus.onnx ONNX
assets/CosyVoice2-0.5B/config.json
assets/CosyVoice2-0.5B/configuration.json
assets/CosyVoice2-0.5B/cosyvoice2.yaml
assets/CosyVoice2-0.5B/flow.cache.pt
assets/CosyVoice2-0.5B/flow.decoder.estimator.fp32.onnx ONNX
assets/CosyVoice2-0.5B/flow.encoder.fp16.zip
assets/CosyVoice2-0.5B/flow.encoder.fp32.zip
assets/CosyVoice2-0.5B/flow.pt
assets/CosyVoice2-0.5B/hift.pt
assets/CosyVoice2-0.5B/merges.txt
assets/CosyVoice2-0.5B/speech_tokenizer_v2.onnx ONNX
assets/CosyVoice2-0.5B/tokenizer_config.json
assets/CosyVoice2-0.5B/vocab.json
assets/token2wav/campplus.onnx ONNX
assets/token2wav/flow.pt
assets/token2wav/flow.yaml
assets/token2wav/hift.pt
assets/token2wav/speech_tokenizer_v2_25hz.onnx ONNX
audio_utils.py
chunk_prefill_generate.py
config.json
configuration_minicpmo.py
configuration_minicpmtts.py
duplex_config.json
duplex_utils.py
generation_config.json
merges.txt
model.safetensors
modeling_minicpmo.py
modeling_navit_siglip.py
preprocessor_config.json
processing_audio_minicpma.py
processing_image_minicpmv.py
processing_minicpmo.py
processing_streaming_mel.py
resampler.py
sliding_utils.py
special_tokens_map.json
stream_decoder.py
stream_providers.py
tokenization_minicpmo_fast.py
tokenizer.json
tokenizer_config.json
tts_streaming_generate.py
utils.py
vocab.json