PPIO正式发布“Fusion融合模型”:用十分之一的价格超越顶级模型的智商

分享
PPIO正式发布“Fusion融合模型”:用十分之一的价格超越顶级模型的智商

省钱又智能的 Fusion 融合模型来了!

跟仅做简单请求转发的传统 API 网关不同,PPIO 智能模型网关正式上线的新功能——Fusion 融合模型会将每次调用变成一场“专家会诊”——网关会将复杂任务同时分发给多个各有所长的“专家模型”并行作答,再通过思考编排与交叉验证,由主模型融合生成最终答案。

Fusion 模型以智能优先、兼顾性价比:通过工程化的融合手段,把回答质量稳定在头部旗舰模型梯队,同时把成本控制在中低梯队。在 DRACO 深度研究基准测试中,PPIO 用三个开源模型融合后的评分超越了 Claude Fable 5,而成本仅为后者的十分之一。

Fusion 融合模型证明,智能的提升不再只发生在参数层,它也可以发生在调用层。

为什么 Agent 时代不能只依赖一个模型?

2026 年,大模型市场进入密集迭代期。Claude、GPT、Kimi、GLM 等主流模型几乎每季度都有新版本发布,排行榜的头部位置频繁更替。对应用开发者而言,可选的模型越来越多,但每个模型都有各自的短板。

从评测数据看,所有的模型能力均存在偏科,并且偏科的方向各不相同。代码生成、长文档理解、数学推理、多语言翻译,当前没有一个模型在所有维度上同时领先,排行榜头部位置按任务类型切分后属于不同的模型。

比偏科更难应对的是幻觉。模型产生幻觉时无法自我发现,错误答案和正确答案在语气、格式、流畅度上没有区别,模型不会对自己不确定的部分做出标记。法律条款解读、医疗建议、金融合规这类场景中,错误一旦被采纳,纠错成本远高于重新生成一次答案,而单模型架构下不存在第二个视角来拦截这个错误。

偏科和幻觉的根源在于,单个模型对同一问题只有一条推理路径,一条路径只能看到一面。复杂问题往往存在多个切入角度,单一路径的遗漏,只有引入另一条独立路径才能发现和补上。

这三个限制在 Agent 场景中的代价尤其大。Agent 逐步执行任务,步骤之间存在依赖关系,一旦某个关键步骤因为偏科、幻觉或视角遗漏出错,后续整条链路跟着走偏,产生的返工成本包含错误之后所有步骤消耗的 Token。

模型越来越多、迭代越来越快,但单模型的这三个限制不会因为换一个更新的模型就消失,它们是架构层面的问题,需要在架构层面解决。

多模型融合推理:让每个模型都发挥更大价值

Fusion 融合模型就是为解决上述问题而生的。用户发送一次请求,网关在内部组织多个模型各自独立作答,再将这些答案经过筛选和融合后返回一份最终回复。

市面上常见的 API 网关做的是转发,请求进来,选一条线路发出去,网关本身不改变答案的质量。PPIO 智能模型网关在转发之外增加了一层编排,让多个模型的产出在返回之前经过比对和融合,因此网关本身成为智能增量的来源。

一次完整的 Fusion 融合模型调用在网关内部走四步。

  1. 请求分发。 网关把问题同时发给多个参考模型。
  2. 并行作答。 各个模型独立作答,互不干扰。
  3. 思考编排。 提取共识,标记分歧,排除错误,同时压缩上下文。
  4. 融合作答。 主模型基于整理后的多方论证生成最终回复。

其中第三步决定融合的质量。多个模型给出一致结论的地方互相印证,降低了偏科带来的盲区;出现冲突的地方被标记出来进一步推敲,为拦截幻觉提供了第二视角;不同推理路径汇总后覆盖面大于任何一条单独路径,补上了单模型视角遗漏的部分。经过这一步整理,主模型定稿时面对的信息量远大于原始问题本身,因此融合结果的质量高于其中任何一个参考模型的单独作答。

由于多个模型同时执行,等待时间取决于最慢的一个,不会随模型数量线性增长,因此引入更多视角并不意味着成倍增加延迟。同时,某个模型调用失败时网关会跳过该模型继续完成融合,多路径的结构反而让整条链路比单模型调用更抗抖动。在 Agent 的多轮交互中,同一回合内已获得的参考结果会被复用,避免重复消耗 Token,所以实际成本增幅远低于“调用了多个模型”这个直觉判断。每次调用经过的模型、消耗的 Token、耗时和成本全部留痕可查,使得智能水平的变化可度量、可追溯。

用1/10的价格超越顶级模型的智商

在 DRACO 深度研究基准测试(专门评估 AI 智能体执行复杂深度研究任务的能力)中,PPIO 以 Kimi K3、GLM 5.2、MiniMax M3 为参考模型(Advisors)、DeepSeek V4 Flash 为融合主模型(Aggregator)进行融合模型推理:

  • 评分 57.34 分,超越 Claude Fable 5(55.14 分);
  • 总成本仅 ¥57.59,是 Claude Fable 5(¥566)的约 1/10

值得一提的是,参与融合的这三个模型单独拿出来都不是各自赛道的榜首,性能提升的部分是由于编排层产生的。这说明智能增量可以来自调用层的组织方式,不必全部依赖基座模型的参数规模。

Agent 时代,模型调用逻辑正在被重构

在 2026 年世界人工智能大会(WAIC)期间,PPIO 联合创始人兼 CEO 姚欣提出了 Agent 时代的核心公式:Agent 生产力 = Token 智能密度 × Agent Loop 时长。

Token 智能密度决定 Agent 每一步决策的质量上限,Agent Loop 时长决定它能持续运行多久、完成多复杂的任务。

过去提升 Token 智能密度,只能被动等下一代模型发布。但是现在,模型的选择权在使用者手里,没有人会被绑死在某一个模型上。PPIO Fusion 融合模型在调用层做编排提升智能密度,让用户无感实现智能的提升。

Agent 的使用方式与人差异很大。人偶尔提问,Agent 高频调用工具、长上下文持续交互、多模型协同,对延迟、稳定性和成本的敏感度远高于传统场景。执行主体从人换成 Agent,模型的服务对象随之重构。

规模上这套能力已经过验证。截至 2026 年 6 月,PPIO 日均 Token 调用量超 1.2 万亿,较 2025 年同期增长超 8 倍。根据灼识咨询统计,在中国独立 AI 云计算服务提供商中,PPIO 日均 Token 消耗量排名第一。今年 PPIO 入选中国信通院首批“企业级 Token 服务性能攀登基线”,通用场景下跑出 TPS ≥ 55 个/秒、TTFT ≤ 0.9 秒、调用成功率 ≥ 99.9% 的指标。

让大模型从“用得起”走向“用得聪明”,让大模型从“单智能”走向“融合智能”,这是 PPIO 智能模型网关正在做的事。

代码零改造,一键接入 Fusion 融合模型

Fusion 融合模型提供 OpenAI 兼容接口,现有代码几乎零改造,只需将model 替换成 pprouter/fusion,即可一键体验 Fusion 融合模型功能。

from openai import OpenAI

client = OpenAI(
    base_url="https://api.ppio.com/openai",
    api_key="<您的 API Key>",
)

response = client.chat.completions.create(
    model="pprouter/fusion",  # ← 就这一行
    messages=[{"role": "user", "content": "审查这份合同的付款条款风险"}],
    stream=True,
)

完整使用文档,包括应用场景、工作原理、费用说明、FAQ等,请见 PPIO 官网文档:https://ppio.com/docs/model/fusion

现在,PPIO 送出一波 Fusion 融合模型福利:点击下方加入 PPIO 产品交流群,可申请 ¥50 的 Fusion 融合模型代金券。将您的产品使用体验反馈给我们,有机会获得进阶代金券。

阅读更多

PPIO 沙箱支持接入 OpenAI Agents API:一键托管 Agent Harness

PPIO 沙箱支持接入 OpenAI Agents API:一键托管 Agent Harness

近期,OpenAI 发布了一个重要的 API 产品:Agents API,把驱动 Codex 和 ChatGPT for Work 的 Harness 基础设施开放给了所有开发者。 这是 OpenAI 最新一代的智能体托管方案。用户只需通过一次 Agents API 调用,指定任务、模型、工具和环境参数,即可创建出可投入实际使用的智能体。 作为国内领先的独立 Agentic Cloud 服务商,PPIO 沙箱已在第一时间完成对 Agents API 的支持接入,成为不可或缺的 Harness 基础设施组件。 国内开发者从今天起可以在 OpenAI 这套全新范式上跑智能体,并自主选择 PPIO 沙箱作为智能体运行环境。 一次 API 调用,换来一个“数字员工”

By luigi
DeepSeek V4.1-Flash 更新后,企业如何管理模型版本、成本与稳定性?

DeepSeek V4.1-Flash 更新后,企业如何管理模型版本、成本与稳定性?

导语: 2026 年 9 月 10 日,DeepSeek 发布 V4.1-Flash,原 V4 Flash 与 V4 Flash Vision Exp 下线,旧模型名称暂时路由至新模型,API 价格同步调整。对于已经把模型 API 用到生产环境的企业而言,这不只是一次模型上新,更是一次需要验证质量、成本与可用性的生产变更。 模型迭代越来越快,企业面临的核心问题也在变化:过去关注的是“能否接入一个模型”,现在更需要回答“模型变化后,业务是否仍然稳定”。 PPIO 已上线 DeepSeek V4.1-Flash,企业可前往 模型详情页 查看模型信息与接入说明。PPIO 模型服务提供大语言模型和多模态模型 API,智能模型网关支持智能路由与多模型混合推理,

By luigi
PPIO加入中国信通院“算力超银生态共建计划”,探索Token普惠新模式

PPIO加入中国信通院“算力超银生态共建计划”,探索Token普惠新模式

2026 年 9 月 2 日,2026 开放数据中心大会暨首届算博会正式(ODX)在国家会议中心二期盛大开幕,由中国信通院发起的“算力超银生态共建计划”首批生态共建伙伴正式发布。 派欧云计算(上海)有限公司(下面简称 PPIO )作为上海市两家算力超银生态共建伙伴之一正式签约加入该计划,PPIO 董事孔杰受邀参加发布仪式。 后续 PPIO 将围绕“算力超市”、“算力银行”两大创新模式开展研究,探索适配大模型时代的算力交易与资源调度新模式。 “算力超市”方向:搭建或依托现有算力平台,通过“算模数用”测评机制认定资源的商品化展示、标准化计价、在线交易与自动交付,推行按“卡时”“核时”及“Token”计费等灵活计费方式,支持中小企业按需采购、随用随付。 “算力银行”方向:建立算力资源“存入—计费—支取—

By luigi
PPIO入选《2026浦东“人工智能+”创新应用典型案例集》

PPIO入选《2026浦东“人工智能+”创新应用典型案例集》

近日,浦东新区科经委面向浦东人工智能产业征集的《2026 浦东“人工智能+”创新应用典型案例集》正式发布。该案例集共收录浦东 42 个示范与创新案例,涵盖教育、医疗、制造、金融、城市治理、能源、半导体、AI 安全等多个赛道。 派欧云计算(上海)有限公司(以下简称 “PPIO”)成功入选该案例集,PPIO 的基于推理加速技术的智能座舱行业模型解决方案已经在智能网联新能源汽车领域应用落地。 智能座舱行业模型解决方案是 PPIO 面向汽车软件企业打造的 AI 推理服务平台,聚焦闭源模型算力成本高、GPU资源供应不稳定、推理流量峰谷波动大等痛点。 平台通过自研推理加速引擎、PD 分离架构与弹性算力调度,为客户提供低成本、低时延、高弹性的开源大模型推理服务。 平台综合采用算子融合、低精度量化、投机采样等技术,突破逐 Token 串行解码效率瓶颈;引入 PD 分离将

By luigi