openFuyao v26.09版本发布

Release-management Maintainer2026-09-30

2026年9月30日

openFuyao v26.09 社区发行版正式上线!多样化算力使能与调度层面,DRA支持NPU软切分,NPU Operator支持纳管NPU DRA与vNPU组件,新增超节点拓扑亲和调度与NPU DRA拓扑亲和调度,有效提升业务性能与资源利用率;AI推理加速场景,InferNex进一步优化大模型部署能力与推理性能;新增Agent沙箱调度能力,实现沙箱并发创建调度吞吐量 > 3000 实例/s;此外,持续增强部署工具核心能力,推出不可变OS部署方案,提升部署成功率与升级稳定性。

立即体验openFuyao v26.09版本

多样化算力使能与调度能力增强 ​

NPU算力卡接入与动态调度

SIG-orchestration-engine 围绕NPU算力卡切分和动态资源配置,实现昇腾 NPU 的精细化管理与灵活调度。

  • vNPU:基于K8s的NPU 算力切分与动态调度组件,支持将一张物理NPU按软切分(单卡最多 20 实例、AI Core 粒度最小 1%、显存最小 1Gi、损耗 <5%)或硬切分两种模式共享给多个容器并实现显存与AI Core隔离,同时提供多样化集群调度(binpack/spread、整卡、资源共享、基于DRA调度)和Prometheus可观测能力,形成一体化极简易用的昇腾NPU算力接入与纳管方案。支持的NPU卡型号如下:

    查看代码仓

    表1:支持的NPU型号及软件版本配套

    芯片型号软切分硬切分HDK版本配套CANN版本配套(软切分)
    310P3支持支持25.5.0及以上版本8.5.0、9.1.0
    910B4支持支持25.5.0及以上版本8.5.0、9.1.0
    910C支持不支持25.5.0及以上版本8.5.0、9.1.0
  • npu-dra-plugin :新增支持软切分,支持 Ascend 910C卡,支持节点内拓扑亲和调度。查看代码仓

  • NPU Operator:新增纳管vNPU和NPU DRA两大能力,支持整卡、硬切分、软切分三种调度模式,并通过ResourceSlice、DeviceClass、与CDI机制实现昇腾NPU的精细化资源管理与灵活调度。查看代码仓

超节点拓扑亲和调度

  • SIG-ub-enable 构建节点侧采集上报能力,由中心侧汇聚超节点对象和超节点拓扑关系资源对象,并与Volcano对接实现集群业务的超节点拓扑感知调度能力,使得业务可以按照不同的诉求调度到合适的超节点中,进而使用超节点的池化内存、大带宽高速通信等能力,提升业务性能。查看代码仓

AI推理加速能力持续升级 ​

SIG-ai-inference 持续增强AI推理加速能力,从TTFT、总吞吐量、权重分发等多维度提升推理性能。

InferNex 进一步优化大模型部署能力与推理性能 InferNex新增支持一键部署GLM-5.2、DeepSeek-V4-Flash等主流MOE大模型;推理引擎升级至vLLM-Ascend 0.23.0,并新增vLLM引擎PodMonitor指标采集,新增Decode-first D/PD路由策略,打通Decode节点KVCache感知与请求直达Decode的完整链路。性能上在定长全随机请求与多轮对话两种场景完成验证,多轮对话场景相比基线首token时延最高降低45.8%,总吞吐量最高提升67.5%。 查看代码仓

表2 InferNex性能表现

优化策略TTFT收益(avg)TPS收益(avg)
random路由策略基线基线
GLM-5.2(聚合,多轮4k×6)45.8%50.9%
GLM-5.2(聚合,多轮8k×6)41.6%67.5%
DeepSeek-V4-Flash(PD分离,多轮4k×6)7.3%2.8%
DeepSeek-V4-Flash(PD分离,多轮8k×6)25.3%10.0%

测试环境:昇腾910B4 32G×32卡、vLLM-Ascend 0.23.0、InferNex 26.9.0-rc.2、aiperf 0.13.0;详细数据见 InferNex整体性能测试报告-v26.09。

可观测与部署效率持续增强

  • InferNex:推理引擎升级至vLLM-Ascend 0.23.0,新增GLM-5.2聚合部署、DeepSeek-V4-Flash PD分离部署示例;新增vLLM引擎PodMonitor指标采集与HTTP/1.0客户端兼容开关,支持复用外部Mooncake Master与Redis元数据服务,并打通traceparent请求头透传。查看代码仓
  • InferNex-Bridge:对齐KServe调度器契约,移除scheduler配置webhook补丁,精简KServe部署示例并兼容restricted PSA策略。查看代码仓
  • InferNex-checker:新增单机与跨节点慢卡检测能力,msprof基准测试增加HCCL通信数据采集,辅助慢卡定位;网络连通性检查改为可选开关。查看代码仓
  • eagle-eye:新增面向vLLM-Ascend的非侵入式端到端分布式链路追踪能力,追踪推理请求从AI网关到推理引擎的完整执行路径,记录各环节耗时和关键业务属性。查看代码仓

Decode-first路由编排贯通全局KVCache感知链路

  • hermes-router:新增Decode-first多级协同路由策略,基于前缀命中率决策:命中充分时直接路由到Decode实例复用其本地KVCache,跳过Prefill环节,否则回落至常规Prefill+Decode编排,有效降低长上下文多轮对话时延。tokenizer sidecar改为单飞初始化并对齐KServe scheduler预设。查看代码仓
  • cache-indexer:新增Decode节点KVCache感知能力,将Decode Pod纳入L1索引发现链路,支撑Decode-first路由准确决策;L1 ingest兼容vLLM 0.24.0的map编码KV事件,避免缓存索引缺失。查看代码仓
  • InferNex proxy-server(随 InferNex 发布):支持Decode-first D/PD路由编排,通过x-openfuyao-decode-pod-address-port请求头将D路由请求直达Decode实例,与P→D编排链路协同工作。

权重分发持续优化RDMA传输性能

  • weight-dispatcher:重构RDMA数据传输实现,新增环形广播(ring broadcast)传输模式,进一步提升模型权重从单一存储节点向多计算节点并发分发的效率。查看代码仓

新增Agent沙箱调度能力 ​

SIG-agent-sandbox 新增高性能Kubernetes沙箱调度引擎FluxSandbox,构建K8s原生、高性能、多运行时兼容的AI Agent沙箱调度系统,将E2B沙箱运行时平滑融入K8s集群并提供低时延高并发的极致调度能力。具体能力如下:

查看代码仓

  • 实现沙箱与普通业务Pod共集群共节点部署,支撑用户现有云原生基础设施统一运维。
  • 沙箱并发创建调度吞吐量 > 3000 实例/s,单沙箱实例调度时延<30ms,满足 RL Training 等场景高并发诉求。
  • 北向兼容OpenSandbox接入协议,无缝对接主流沙箱生态。
  • 多运行时兼容架构,已支持对接 E2B 和 containerd runc,提供不同安全隔离级别。
  • 支持沙箱创建、删除、快照、暂停、恢复等生命周期管理。

新增Serverless数据库管控面Operator ​

SIG-orchestration-engine 新增Serverless数据库管控面Operator —— serverlessdb-operator。serverlessdb operator是面向短生命周期、突发负载场景的Serverless数据库管控面Operator。基于Kubernetes Operator扩展机制,维护预热数据库计算实例资源池,对外提供REST接口支持数据库计算实例的按需申请、释放与原地垂直扩缩容等操作。具体能力如下:

查看代码仓

  • 数据库扩容:将数据库扩缩容从分级运维操作转变为运行时API能力,支持用户在Agent场景实现数据库的快速启动、弹性伸缩与按需释放。
  • 毫秒级申请:申请实例仅做label/status变更,从预热池中秒级分配,无需冷启动。
  • 连接地址不变:数据库实例释放后DNS地址保留,重新申请可复用,保证实例释放后重新申请连接地址保持不变。
  • 兼容K8s机制:支持K8s原生机制的认证鉴权保证安全、支持高可用生产级能力和冗余Service的回收。

安装部署能力持续演进 ​

SIG-installation 增强部署工具核心能力,推出不可变OS部署方案。具体如下:

参看代码仓

  • 支持不可变OS:可在普通openEuler 控制平面节点接入KubeOS Worker节点,实现KubeOS Worker节点整镜像原子升级、回滚与生命周期管理。

  • BKE工具增强:新增preflight子命令,用于在集群初始化及创建前执行前置依赖检查,确保环境满足要求。参看代码仓

  • 升级引擎重构:优化声明式升级框架,集成组件执行引擎,实现YAML和Helm组件的标准化适配与执行。

  • 状态管理统一:重构BKECluster资源定义,以ClusterStatus作为集群状态的唯一数据源,消除状态显示歧义。

  • 去中心化负载均衡:worker节点部署Nginx Proxy,实现集群流量去中心化转发与高效负载均衡。

  • 配置热更新:实现K8s核心组件及Etcd静态Pod配置的热更新机制,支持集群运行时动态变更配置。

集群安全加固 ​

SIG-security-committee 新增集群安全加固工具 Compliance-hardening :可对于已经识别的弱安全配置,提供一键式加固和回退的能力,不耦合主安全流程。具体能力如下:

查看代码仓

  • 六大加固组:覆盖静态Pod manifest权限、apiserver/controller-manager/scheduler参数、etcd参数与数据目录、kubelet配置等。

  • 预览与确认:改动前先预览全集群合规状态,保证不误伤配置。

  • 一键回退:支持各节点回退各自最新备份或统一时间戳回退到同一状态。

本文由openFuyao社区首发,欢迎遵照CC-BY-SA 4.0协议规定转载。