技术博客
沉淀 AI 算力、无损网络、高速互联、集群验收和 AIDC 工程实践,帮助团队更快识别问题、验证方案和复用经验。

优化 AI 推理工作负载:降低时延、提升吞吐并控制成本
AI 推理系统需要在时延、吞吐和成本之间取得平衡。本文从模型压缩、KV Cache、批处理、互连网络和硬件选型等角度,解析如何优化大规模推理工作负载。

大语言模型推理中的 Prefix Caching 前缀缓存解析
深入解析前缀缓存如何通过跨请求复用 KV 缓存状态,优化大语言模型推理性能。涵盖其工作原理、与标准 KV 缓存的核心区别,以及在多轮对话、RAG 与少样本学习等场景中的实际应用。

ODCC AI存储实验室KV Cache评测再发布:英韧N3X以硬核SSD性能筑牢AI推理引擎
随着大模型发展全面迈入规模化推理部署的新阶段,推理性能、成本控制与资源利用率,正在成为智算基础设施建设的核心命题。在这一过程中,存储已不再只是数据承载的底层

NVIDIA DGX Rubin NVL8 技术解析:面向 AI 训练与推理的加速平台
NVIDIA DGX Rubin NVL8 搭载 8 颗 Rubin GPU,采用台积电 3nm 工艺与 HBM4 内存,配备第六代 NVLink 实现 28.8 TB/s 互联带宽,为大规模 AI 训练与高并发推理提供均衡、高效的硬件平台。

ODCC AI存储实验室首发KV Cache评测结果:焱融YRCache实现推理提速降本双突破
随着大模型发展全面迈入规模化推理部署的新阶段,行业关注点正加速向推理性能、成本控制与资源利用率转移。在这一过程中,存储作为AI基础设施的核心支撑环节,正从传

AI训练 vs 推理:为什么你需要两种不同的网络架构
AI训练与推理对网络的需求截然不同——训练需要高带宽、无损、全局同步;推理则要求低延迟、弹性扩展、成本可控。本文系统解析两种工作负载的网络诉求差异,以及RoCEv2为何成为推理时代的主流选择。

RTX PRO 5000 性能实测:72GB 大显存让大模型推理更从容
过去两年,大模型应用的重心正在快速从“训练”转向“推理”。越来越多的团队开始在本地或私有环境中部署模型:代码

MTP®/MPO Jumper、Harness、Trunk如何选择?
在高密度数据中心和AI网络架构中,MTP/MPO光纤组件选型决定布线效率。本文基于距离、功能和布线层级,系统解析Jumper、Harness和Trunk的适用场景与选型要点,帮助快速做出正确决策。

MPO Trunk光缆是什么?结构、类型与应用场景全解析
MPO Trunk光缆是高密度数据中心主干布线的核心组件,支持48-192芯高密度并行传输,采用预端接设计与双护套结构,大幅提升部署效率与物理耐久性,为400G/800G AI算力集群提供稳定的光纤底座。

