综合性价比超越硅谷,PPIO派欧云发布下一代推理加速引擎

https://www.jiemian.com/article/11486699.html

综合性价比超越硅谷,PPIO派欧云发布下一代推理加速引擎

界面新闻报道

由中国计算机学会(CCF)主办的CCF Computility 2024分布式计算大会暨全国开放式分布与并行计算学术年会在长春市举办。

2024年07月30日 11:19

(2024年7月28日,长春)2024年7月26至28日,由中国计算机学会(CCF)主办的“CCF Computility 2024分布式计算大会暨全国开放式分布与并行计算学术年会”在长春市举办。陈国良院士、于全院士、郑纬民院士等11位院士与学术界和产业界的1000多位顶级专家齐聚一堂,深入探讨分布式计算与算力网的最新进展,推动科技与产业的深度融合。

作为中国领先的分布式云服务商,PPIO派欧云联合创始人、董事长兼CEO姚欣受邀参会并发表题为《面向下一代人工智能的分布式智算网络建设与运营》的主题演讲,正式发布下一代分布式推理加速技术产品——派欧算力云推理加速引擎。

性价比领先:推理性能提升十倍,综合成本降低90%

派欧算力云推理加速引擎通过一系列自研推理加速算法,使大语言模型(LLM)推理性能提升10倍。同时,PPIO派欧云还积极在硬件层构建分布式算力基础设施,将综合推理成本降低90%以上。不仅推理性能超越了众多硅谷AI Infra头部公司,还具备显著的成本优势,助力更多开发者使用大模型技术进行应用创新。

为了突破显存、算力和带宽对大模型推理性能的限制,PPIO派欧云通过算法、系统和硬件的协同创新实践,推出三大核心技术,通过Pyramid Cache稀疏化压缩算法、Hydra Sampling投机采样技术以及端到端FP8推理,打造全球领先的下一代高性价比算力云推理加速引擎。这些技术显著提升了推理加速优化的潜能,实现成本与性能之间的最佳平衡,为开发者提供了卓越性价比的大模型推理服务。

Pyramid Cache稀疏化压缩算法:

与当前主流压缩优化思路不同,Pyramid Cache稀疏化压缩算法分析计算注意力分数在不同层上的分布模式,为不同层动态分配不同KV Cache预算,在压缩比和模型性能之间取得最佳匹配。实验表明,该方法将KV Cache压缩至10%以内,同时保持95%以上的模型性能表现,最终将GPU内存开销降低至20%,显著提高GPU内存资源利用率,不仅满足长窗口的推理需求,还进一步将端到端推理效率提升2倍以上。

Hydra Sampling投机采样技术:

针对传统大模型推理过程中每次仅生成一个token导致的低吞吐量问题,PPIO派欧云创新实现了基于多头并行推理的Hydra Sampling投机采样技术。大量实验证实,在传统的投机采样算法中,草稿模型的输出token接受率严重影响推理效率。为此,PPIO通过用场景数据在线更新草稿模型,使得草稿模型逐渐拟合目标大模型,相应的输出token接受率可以进一步提高。基于这种在线动态更新机制,草稿模型越用越聪明,推理效率也随之越来越高,端到端综合性能优化达到2倍以上,处理更多请求的同时,推理性价比显著提升。

端到端FP8推理:

PPIO派欧云重写了核心的注意力算法,直接调用FP8 TensorCore进行注意力计算,并使用FP8保存KV Cache,避免FP16格式的中间结果转换和传输,实现全链路FP8计算。通过这些优化,显著降低数据存储和通信成本,端到端推理效率提升约2倍,充分释放硬件算力潜能。

在三项创新技术的支持下,派欧算力云产品基于自研的推理加速引擎能够迅速适配和优化开源大模型,第一时间上架Llama3.1-405B、Mixtral 8x22B等20多个开源高性能大模型,API正常运行时间达到99.99% 。与GPT-4o相比,通过派欧算力云产品微调和优化的Llama3.1-70b模型,其Input token价格降低了90%,Output token价格降低了95%。派欧算力云产品还通过第三方大模型API平台为全球开发者提供高性能推理服务,相比于OctoAI、Lepton、Together、Fireworks等硅谷公司,派欧算力云产品在综合性价比上具有显著优势,确保开发者在享受高性能、稳定的推理服务的同时,获得前所未有的成本效益。

*数据来自第三方大模型API平台(7月28日)

灵活产品形态,共建繁荣AI开发者和产学研生态

派欧算力云推理加速引擎可广泛应用于多个场景,提供灵活且高效的解决方案。在大模型服务方面,用户只需几行代码即可享受高性价比的推理服务,并且只需为实际消耗的token数量付费。这种方式极大地降低了用户的使用门槛和成本,帮助企业专注于自身业务的增长和发展。

不仅如此,派欧算力云产品还提供容器化的推理基础设施,满足模型定制和私有部署的需求。用户无需担心底层的计算资源管理,只需专注于模型和上层业务,即可自动获得强大的推理性能输出,并按使用时长付费。这种灵活的服务模式使得企业能够快速部署和扩展推理服务,适应不断变化的业务需求。

同时,PPIO派欧云积极推动高校学术合作和人才培养。PPIO派欧云首席科学家王晓飞教授在大会发表演讲,分享了PPIO与天津大学在分布式算力云方向的产学研合作最新动态,并介绍了通过汇聚网络边缘侧与端侧算力资源、构建混合异构分布式算力网络的实践案例。此外,依托此次CCF分布式计算大会,PPIO联合中国计算机学会分布式计算与系统专业委员会、中国科学院计算技术研究所分布式系统研究中心、鹏城实验室网络智能研究部,举办第一届CCF算力网系统与应用大赛。大赛旨在激发青年学生的创新创造力,深入了解算力网的系统架构和关键技术,推动算力网技术的创新发展和落地应用,为算力网等分布式领域的创新人才培养和新质生产力实践提供开放合作的平台。经过激烈角逐,最终由南京大学、国防科技大学和河北工业大学队伍获得大赛一等奖。

姚欣强调,随着推理需求的不断增长,降低成本是大势所趋。PPIO派欧云将继续深耕分布式计算及推理加速技术的研究与应用,不断更新迭代推理加速引擎,力求在性能和成本上实现新的飞跃。PPIO的目标是让推理成本降低90%、99%、甚至99.9%,使更多AI创业企业和开发者能够轻松承担大模型推理的费用,从而真正构建出赋能AIGC应用爆发的基础设施。

关于PPIO派欧云

PPIO派欧云是中国领先的分布式云服务商,由PPTV创始人、前蓝驰创投投资合伙人姚欣和前PPTV首席架构师王闻宇于2018年联合创立,公司秉承“汇聚全球计算资源,并为全世界提供服务”的使命,致力于为人工智能、音视频、元宇宙等新一代场景,提供极致高性价比的一站式算力、模型及边缘计算服务。

2019年,公司推出产品派欧边缘云,基于共享经济的商业模式,结合行业领先的边缘云原生、大数据、分布式计算技术,在网络边缘侧基础设施上,建构了覆盖全球的高质量边缘云计算服务网络,并实现与传统中心云的智能兼容和协同。派欧边缘云已在全球1200多个城市及地区设立了3500多个算力节点,为客户提供低时延、高带宽、广覆盖的边缘CDN、边缘计算、边缘渲染等计算和网络服务。派欧边缘云成为多家互联网巨头、一线云计算服务商、独角兽公司在边缘云服务领域的首选合作伙伴。

2023年,公司推出全新的AI基础设施产品 - 派欧算力云,依托推理加速、分布式计算等创新技术,释放推理计算潜能。为企业和开发者提供高性价比、弹性、易用的GPU 容器实例、模型托管和AIGC大模型等一站式AI服务。助力客户摆脱搭建和运维服务器的繁琐,更省钱、省时、省力地构建AIGC应用,聚焦应用创新与业务增长,为全球智能技术发展注入全新动力。

PPIO派欧云已在上海、北京、深圳、西安、武汉等地设立多个办公室,汇聚了众多来自微软、谷歌、华为、腾讯、阿里巴巴、百度等知名高科技公司的顶尖技术专家,通过不断优化和扩展产品与服务能力,加速推动下一个智能时代的到来。

免责声明:本文为本网站出于传播商业信息之目的进行转载发布,不代表本网站的观点及立场。本文所涉文、图、音视频等资料之一切权利和法律责任归材料提供方所有和承担。本网站对此资讯文字、图片等所有信息的真实性不作任何保证或承诺,亦不构成任何购买、投资等建议,据此操作者风险自担。

本文为转载内容,授权事宜请联系原著作权人。

Read more

PPIO上线“企业Token Plan”:主流旗舰模型最低6折接入,支持200席位

PPIO上线“企业Token Plan”:主流旗舰模型最低6折接入,支持200席位

AI 应用落地进入规模化阶段后,企业面临的挑战已经从“能不能用”变成了“怎么用得起、用得稳、管得住”。 过去一年,模型 API 的调用成本普遍下降了一个数量级,但这并没有让企业的 AI 预算问题消失。主流可用的模型从三五个变成了十几个,每家厂商定价体系不同,缓存机制不同,并发限制也不同。多模型混用的企业团队,往往需要维护多个账户、多套账单,遇到某个模型价格调整或服务波动时处理起来相当被动。 而现在,PPIO 发布的企业 Token Plan,正是要解决这些问题。 一键接入 17 款主流大模型,支持 200 席位 PPIO 企业 Token Plan 是一套标准化的预付费折扣产品,核心机制是“融合 Token”:以 DeepSeek V4 Flash 输入 Token 为基准单位(

By PPIO
PPIO正式发布“Fusion融合模型”:用十分之一的价格超越顶级模型的智商

PPIO正式发布“Fusion融合模型”:用十分之一的价格超越顶级模型的智商

省钱又智能的 Fusion 融合模型来了! 跟仅做简单请求转发的传统 API 网关不同,PPIO 智能模型网关正式上线的新功能——Fusion 融合模型会将每次调用变成一场“专家会诊”——网关会将复杂任务同时分发给多个各有所长的“专家模型”并行作答,再通过思考编排与交叉验证,由主模型融合生成最终答案。 Fusion 模型以智能优先、兼顾性价比:通过工程化的融合手段,把回答质量稳定在头部旗舰模型梯队,同时把成本控制在中低梯队。在 DRACO 深度研究基准测试中,PPIO 用三个开源模型融合后的评分超越了 Claude Fable 5,而成本仅为后者的十分之一。 Fusion 融合模型证明,智能的提升不再只发生在参数层,它也可以发生在调用层。 为什么 Agent 时代不能只依赖一个模型? 2026 年,大模型市场进入密集迭代期。Claude、GPT、Kimi、GLM 等主流模型几乎每季度都有新版本发布,排行榜的头部位置频繁更替。对应用开发者而言,可选的模型越来越多,但每个模型都有各自的短板。

By PPIO
爆满收官!PPIO构建AI落地“最强朋友圈”

爆满收官!PPIO构建AI落地“最强朋友圈”

WAIC开展前夜,7月16日,我们在上海北外滩组织了一场AI Builders Night。 从模型、Agent 到算力、数据与应用,AI 行业的变化越来越快。 但当热度持续攀升,一个更具体的问题也被反复提起:技术能力不断向前,究竟有多少产品真正进入了业务,进入了用户的工作流,进入了真实世界? 这一次,我们把讨论留给正在一线推进的人。 # 01 重磅圆桌 行业大佬拆解AI落地真相 我们邀请了四位深耕AI产业、落地经验丰富的重磅嘉宾:PPIO 合伙人陆昆仑、明略科技创始人吴明辉、Joulebeat 创始人向涛,以及蚂蚁集团副总裁 & 蚂蚁百灵大模型负责人周俊。 讨论全程聚焦AI创业、产品落地的真实痛点与真实困惑:团队踩过的实战深坑、被用户否决的功能、倒逼产品改版的客户反馈、曾经判断失误的行业决策。 比起复盘“做对了什么”,这些真实的试错成本、尚未解决的行业难题,才是更有参考价值的行业经验。 几位嘉宾以不同赛道、不同视角的观点交锋,展开了激烈的探讨,最终沉淀出统一共识:AI的价值从来不在于单次演示的惊艳效果,而在于能否打通企业数据与系统、适配复杂业务流程,

By luigi