登录
微信登录
打开手机微信,扫描二维码
扫描成功
请勿刷新本页面,按手机提示操作
中科曙光不会以任何理由要求您转账汇款,谨防诈骗
您的微信还未注册
中科曙光不会以任何理由要求您转账汇款,谨防诈骗
您可以同时关注中科曙光微信公众号
使用微信扫一扫即可登录! 查阅资料更方便、 快捷!
您已经注册账号和
关注微信公众号
2025年1月
服务热线:400-810-0466
请完成安全验证
发布时间: 2026-08-11
7月,曙光8000十万卡AI超集群上线,支撑这套超大规模体系高效运转的核心底座,正是Gridview 7.0超智融合算力管理平台。从资源调度到业务支撑再到集群运维,这套平台给出了大规模算力高效落地的完整解法。

对于十万卡级超大规模集群,故障定位难、运维粒度粗是普遍痛点。传统监控体系覆盖维度有限,硬件故障、链路异常往往需要人工逐层排查,难以支撑7×24小时稳定运营。
Gridview 7.0构建了存/算/传/管/用全链路可观测体系,覆盖芯片级到集群级六级监控维度,监控指标超2亿项,既可宏观掌握集群整体利用率,也能微观定位单张加速卡的通信链路异常,实现万卡集群精细化运维。
除此之外,平台配套三员分离安全合规体系、全栈国产化适配、开箱即用部署能力,以及Token计量运营模式,早已突破传统调度器范畴,成为一套完整的算力运营基础设施,可适配超算中心、行业算力平台等多场景商业化运营需求。
算力产业的竞争重心,正从“能不能建起来”转向“能不能用得好”。如果说算力建设的上半场比拼的是规模扩张速度,下半场的核心则是利用效率与精细化运营。Gridview 7.0以统一平台实现双引擎调度、全链路智能支撑,为超算与智算协同发展提供了可行路径,也印证了行业共识:算力的核心价值,从来不在硬件规模本身,而在于算力最终产出的实际成果。
传统算力管理平台多止步于资源调度与状态监控,用户需自行完成软件环境部署、参数调优、故障排查,大量研发时间消耗在算力适配环节,而非核心业务创新。
Gridview 7.0内置科研智能体与运维智能体双体系,将平台能力从资源管理延伸至业务全流程支撑。科研智能体预置主流计算软件环境与自动化流程,用户无需从零搭建环境,聚焦业务需求即可获取计算成果;运维智能体则实现万级节点自动化运维,故障预警、报错分析、资源优化推荐均可智能响应,大幅降低大规模集群的运维门槛。
落地数据显示,在材料研发、基因测序等典型科研场景中,依托平台智能化支撑,用户从需求提出到成果交付的端到端研发效率提升可达300%。
长期以来,科学计算与智能计算分属两套独立体系:Slurm承载科学计算作业,Kubernetes支撑AI训练任务,资源割裂、无法动态调配,峰谷期利用率差异悬殊,造成大量算力闲置浪费。
Gridview7.0采用自研MetaStack + K8s双引擎原生融合架构,通过底层调度引擎打通两套体系,计算节点可在双引擎间灵活无感迁移,实现同一算力池错峰复用。例如日间承载高优先级AI训练,夜间切换运行科学仿真计算,从根源打破两类算力的资源壁垒。
实测数据显示,平台单集群可支撑10000 +计算节点稳定运行,双擎并行模式下作业吞吐率达813万作业/小时,性能较原生开源Slurm提升近8倍;全年可用性达99.99%,可支撑单作业10万+核规模稳定运行。针对万卡集群中高频查询易阻塞调度核心节点的行业通病,平台采用数控分离架构,查询与调度链路分流互不干扰,筑牢了大规模集群的生产稳定性底线。#中科曙光

津公网安备 12011602000521号



注册 /