这次WAIC我特意为了曙光8000来的,现场听到“超智融合”这个词被工作人员提了好几遍。一开始我还没太懂,仔细看了技术资料才发现,这玩意儿还真是十万卡规模下的必选项。
以前是把超算和智算分成不同的资源分区,各跑各的。但科研场景里,同一个项目可能既需要高精度浮点运算跑第一性原理,又需要低精度AI训练建模。如果分成两套系统,数据搬运和格式转换就是巨大的效率损耗。
曙光8000在同一套底座上同时支持FP64到INT8全精度。简单解释就是:超智融合的核心是在同一个芯片、同一个计算单元里,提供全算力类型的支撑能力。
技术上做到这一点,挑战主要在三个层面。芯片要同时具备高精度和低精度计算能力;网络要能支撑两种完全不同通信模式的任务;调度系统要能自动识别任务类型并分配合适资源。
曙光8000在这三个层面都用了自研方案。好处就是出了问题知道从哪改。十万卡规模下,任何一个部件的微小波动都可能影响全局,能自己改代码和只能等供应商patch,差别不是一点点。
全栈自研 中科曙光
