openFuyao v26.09版本发布
2026年9月30日
openFuyao v26.09 社区发行版正式上线!多样化算力使能与调度层面,DRA支持NPU软切分,NPU Operator支持纳管NPU DRA与vNPU组件,新增超节点拓扑亲和调度与NPU DRA拓扑亲和调度,有效提升业务性能与资源利用率;AI推理加速场景,InferNex进一步优化大模型部署能力与推理性能;新增Agent沙箱调度能力,实现沙箱并发创建调度吞吐量 > 3000 实例/s;此外,持续增强部署工具核心能力,推出不可变OS部署方案,提升部署成功率与升级稳定性。
多样化算力使能与调度能力增强
NPU算力卡接入与动态调度
SIG-orchestration-engine 围绕NPU算力卡切分和动态资源配置,实现昇腾 NPU 的精细化管理与灵活调度。
vNPU:基于K8s的NPU 算力切分与动态调度组件,支持将一张物理NPU按软切分(单卡最多 20 实例、AI Core 粒度最小 1%、显存最小 1Gi、损耗 <5%)或硬切分两种模式共享给多个容器并实现显存与AI Core隔离,同时提供多样化集群调度(binpack/spread、整卡、资源共享、基于DRA调度)和Prometheus可观测能力,形成一体化极简易用的昇腾NPU算力接入与纳管方案。支持的NPU卡型号如下:
表1:支持的NPU型号及软件版本配套
芯片型号 软切分 硬切分 HDK版本配套 CANN版本配套(软切分) 310P3 支持 支持 25.5.0及以上版本 8.5.0、9.1.0 910B4 支持 支持 25.5.0及以上版本 8.5.0、9.1.0 910C 支持 不支持 25.5.0及以上版本 8.5.0、9.1.0 npu-dra-plugin :新增支持软切分,支持 Ascend 910C卡,支持节点内拓扑亲和调度。查看代码仓
NPU Operator:新增纳管vNPU和NPU DRA两大能力,支持整卡、硬切分、软切分三种调度模式,并通过ResourceSlice、DeviceClass、与CDI机制实现昇腾NPU的精细化资源管理与灵活调度。查看代码仓
超节点拓扑亲和调度
- SIG-ub-enable 构建节点侧采集上报能力,由中心侧汇聚超节点对象和超节点拓扑关系资源对象,并与Volcano对接实现集群业务的超节点拓扑感知调度能力,使得业务可以按照不同的诉求调度到合适的超节点中,进而使用超节点的池化内存、大带宽高速通信等能力,提升业务性能。查看代码仓
AI推理加速能力持续升级
SIG-ai-inference 持续增强AI推理加速能力,从TTFT、总吞吐量、权重分发等多维度提升推理性能。
InferNex 进一步优化大模型部署能力与推理性能 InferNex新增支持一键部署GLM-5.2、DeepSeek-V4-Flash等主流MOE大模型;推理引擎升级至vLLM-Ascend 0.23.0,并新增vLLM引擎PodMonitor指标采集,新增Decode-first D/PD路由策略,打通Decode节点KVCache感知与请求直达Decode的完整链路。性能上在定长全随机请求与多轮对话两种场景完成验证,多轮对话场景相比基线首token时延最高降低45.8%,总吞吐量最高提升67.5%。 查看代码仓
表2 InferNex性能表现
| 优化策略 | TTFT收益(avg) | TPS收益(avg) |
|---|---|---|
| random路由策略 | 基线 | 基线 |
| GLM-5.2(聚合,多轮4k×6) | 45.8% | 50.9% |
| GLM-5.2(聚合,多轮8k×6) | 41.6% | 67.5% |
| DeepSeek-V4-Flash(PD分离,多轮4k×6) | 7.3% | 2.8% |
| DeepSeek-V4-Flash(PD分离,多轮8k×6) | 25.3% | 10.0% |
测试环境:昇腾910B4 32G×32卡、vLLM-Ascend 0.23.0、InferNex 26.9.0-rc.2、aiperf 0.13.0;详细数据见 InferNex整体性能测试报告-v26.09。
可观测与部署效率持续增强
- InferNex:推理引擎升级至vLLM-Ascend 0.23.0,新增GLM-5.2聚合部署、DeepSeek-V4-Flash PD分离部署示例;新增vLLM引擎PodMonitor指标采集与HTTP/1.0客户端兼容开关,支持复用外部Mooncake Master与Redis元数据服务,并打通traceparent请求头透传。查看代码仓
- InferNex-Bridge:对齐KServe调度器契约,移除scheduler配置webhook补丁,精简KServe部署示例并兼容restricted PSA策略。查看代码仓
- InferNex-checker:新增单机与跨节点慢卡检测能力,msprof基准测试增加HCCL通信数据采集,辅助慢卡定位;网络连通性检查改为可选开关。查看代码仓
- eagle-eye:新增面向vLLM-Ascend的非侵入式端到端分布式链路追踪能力,追踪推理请求从AI网关到推理引擎的完整执行路径,记录各环节耗时和关键业务属性。查看代码仓
Decode-first路由编排贯通全局KVCache感知链路
- hermes-router:新增Decode-first多级协同路由策略,基于前缀命中率决策:命中充分时直接路由到Decode实例复用其本地KVCache,跳过Prefill环节,否则回落至常规Prefill+Decode编排,有效降低长上下文多轮对话时延。tokenizer sidecar改为单飞初始化并对齐KServe scheduler预设。查看代码仓
- cache-indexer:新增Decode节点KVCache感知能力,将Decode Pod纳入L1索引发现链路,支撑Decode-first路由准确决策;L1 ingest兼容vLLM 0.24.0的map编码KV事件,避免缓存索引缺失。查看代码仓
- InferNex proxy-server(随 InferNex 发布):支持Decode-first D/PD路由编排,通过
x-openfuyao-decode-pod-address-port请求头将D路由请求直达Decode实例,与P→D编排链路协同工作。
权重分发持续优化RDMA传输性能
- weight-dispatcher:重构RDMA数据传输实现,新增环形广播(ring broadcast)传输模式,进一步提升模型权重从单一存储节点向多计算节点并发分发的效率。查看代码仓
新增Agent沙箱调度能力
SIG-agent-sandbox 新增高性能Kubernetes沙箱调度引擎FluxSandbox,构建K8s原生、高性能、多运行时兼容的AI Agent沙箱调度系统,将E2B沙箱运行时平滑融入K8s集群并提供低时延高并发的极致调度能力。具体能力如下:
- 实现沙箱与普通业务Pod共集群共节点部署,支撑用户现有云原生基础设施统一运维。
- 沙箱并发创建调度吞吐量 > 3000 实例/s,单沙箱实例调度时延<30ms,满足 RL Training 等场景高并发诉求。
- 北向兼容OpenSandbox接入协议,无缝对接主流沙箱生态。
- 多运行时兼容架构,已支持对接 E2B 和 containerd runc,提供不同安全隔离级别。
- 支持沙箱创建、删除、快照、暂停、恢复等生命周期管理。
新增Serverless数据库管控面Operator
SIG-orchestration-engine 新增Serverless数据库管控面Operator —— serverlessdb-operator。serverlessdb operator是面向短生命周期、突发负载场景的Serverless数据库管控面Operator。基于Kubernetes Operator扩展机制,维护预热数据库计算实例资源池,对外提供REST接口支持数据库计算实例的按需申请、释放与原地垂直扩缩容等操作。具体能力如下:
- 数据库扩容:将数据库扩缩容从分级运维操作转变为运行时API能力,支持用户在Agent场景实现数据库的快速启动、弹性伸缩与按需释放。
- 毫秒级申请:申请实例仅做label/status变更,从预热池中秒级分配,无需冷启动。
- 连接地址不变:数据库实例释放后DNS地址保留,重新申请可复用,保证实例释放后重新申请连接地址保持不变。
- 兼容K8s机制:支持K8s原生机制的认证鉴权保证安全、支持高可用生产级能力和冗余Service的回收。
安装部署能力持续演进
SIG-installation 增强部署工具核心能力,推出不可变OS部署方案。具体如下:
支持不可变OS:可在普通openEuler 控制平面节点接入KubeOS Worker节点,实现KubeOS Worker节点整镜像原子升级、回滚与生命周期管理。
BKE工具增强:新增preflight子命令,用于在集群初始化及创建前执行前置依赖检查,确保环境满足要求。参看代码仓
升级引擎重构:优化声明式升级框架,集成组件执行引擎,实现YAML和Helm组件的标准化适配与执行。
状态管理统一:重构BKECluster资源定义,以ClusterStatus作为集群状态的唯一数据源,消除状态显示歧义。
去中心化负载均衡:worker节点部署Nginx Proxy,实现集群流量去中心化转发与高效负载均衡。
配置热更新:实现K8s核心组件及Etcd静态Pod配置的热更新机制,支持集群运行时动态变更配置。
集群安全加固
SIG-security-committee 新增集群安全加固工具 Compliance-hardening :可对于已经识别的弱安全配置,提供一键式加固和回退的能力,不耦合主安全流程。具体能力如下:
六大加固组:覆盖静态Pod manifest权限、apiserver/controller-manager/scheduler参数、etcd参数与数据目录、kubelet配置等。
预览与确认:改动前先预览全集群合规状态,保证不误伤配置。
一键回退:支持各节点回退各自最新备份或统一时间戳回退到同一状态。
本文由openFuyao社区首发,欢迎遵照CC-BY-SA 4.0协议规定转载。
