技术博客

沉淀 AI 算力、无损网络、高速互联、集群验收和 AIDC 工程实践,帮助团队更快识别问题、验证方案和复用经验。

优化 AI 推理工作负载:降低时延、提升吞吐并控制成本
技术文章

优化 AI 推理工作负载:降低时延、提升吞吐并控制成本

AI 推理系统需要在时延、吞吐和成本之间取得平衡。本文从模型压缩、KV Cache、批处理、互连网络和硬件选型等角度,解析如何优化大规模推理工作负载。

查看详情
大语言模型推理中的 Prefix Caching 前缀缓存解析
技术文章

大语言模型推理中的 Prefix Caching 前缀缓存解析

深入解析前缀缓存如何通过跨请求复用 KV 缓存状态,优化大语言模型推理性能。涵盖其工作原理、与标准 KV 缓存的核心区别,以及在多轮对话、RAG 与少样本学习等场景中的实际应用。

查看详情
ODCC AI存储实验室KV Cache评测再发布:英韧N3X以硬核SSD性能筑牢AI推理引擎
技术文章

ODCC AI存储实验室KV Cache评测再发布:英韧N3X以硬核SSD性能筑牢AI推理引擎

随着大模型发展全面迈入规模化推理部署的新阶段,推理性能、成本控制与资源利用率,正在成为智算基础设施建设的核心命题。在这一过程中,存储已不再只是数据承载的底层

查看详情
NVIDIA DGX Rubin NVL8 技术解析:面向 AI 训练与推理的加速平台
技术文章

NVIDIA DGX Rubin NVL8 技术解析:面向 AI 训练与推理的加速平台

NVIDIA DGX Rubin NVL8 搭载 8 颗 Rubin GPU,采用台积电 3nm 工艺与 HBM4 内存,配备第六代 NVLink 实现 28.8 TB/s 互联带宽,为大规模 AI 训练与高并发推理提供均衡、高效的硬件平台。

查看详情
ODCC AI存储实验室首发KV Cache评测结果:焱融YRCache实现推理提速降本双突破
技术文章

ODCC AI存储实验室首发KV Cache评测结果:焱融YRCache实现推理提速降本双突破

随着大模型发展全面迈入规模化推理部署的新阶段,行业关注点正加速向推理性能、成本控制与资源利用率转移。在这一过程中,存储作为AI基础设施的核心支撑环节,正从传

查看详情
AI训练 vs 推理:为什么你需要两种不同的网络架构
技术文章

AI训练 vs 推理:为什么你需要两种不同的网络架构

AI训练与推理对网络的需求截然不同——训练需要高带宽、无损、全局同步;推理则要求低延迟、弹性扩展、成本可控。本文系统解析两种工作负载的网络诉求差异,以及RoCEv2为何成为推理时代的主流选择。

查看详情
RTX PRO 5000 性能实测:72GB 大显存让大模型推理更从容
技术文章

RTX PRO 5000 性能实测:72GB 大显存让大模型推理更从容

过去两年,大模型应用的重心正在快速从“训练”转向“推理”。越来越多的团队开始在本地或私有环境中部署模型:代码

查看详情
MTP®/MPO Jumper、Harness、Trunk如何选择?
技术文章

MTP®/MPO Jumper、Harness、Trunk如何选择?

在高密度数据中心和AI网络架构中,MTP/MPO光纤组件选型决定布线效率。本文基于距离、功能和布线层级,系统解析Jumper、Harness和Trunk的适用场景与选型要点,帮助快速做出正确决策。

查看详情
MPO Trunk光缆是什么?结构、类型与应用场景全解析
技术文章

MPO Trunk光缆是什么?结构、类型与应用场景全解析

MPO Trunk光缆是高密度数据中心主干布线的核心组件,支持48-192芯高密度并行传输,采用预端接设计与双护套结构,大幅提升部署效率与物理耐久性,为400G/800G AI算力集群提供稳定的光纤底座。

查看详情