技术博客

沉淀 AI 算力、无损网络、高速互联、集群验收和 AIDC 工程实践,帮助团队更快识别问题、验证方案和复用经验。

常见光模块故障原因与保护措施
技术文章

常见光模块故障原因与保护措施

本文系统梳理光模块在高速数据中心和AI集群中的常见故障原因——包括ESD损伤、光口污染、劣质连接器、器件老化、兼容性问题和环境压力,并提供对应的保护措施与选型建议,帮助提升链路稳定性与运维效率。

查看详情
NVIDIA 全面升级 RTX PC 和 DGX Spark 上的本地 AI 智能体
技术文章

NVIDIA 全面升级 RTX PC 和 DGX Spark 上的本地 AI 智能体

个人智能体正迎来爆发式增长,OpenClaw 和 Hermes 等开源项目在 GitHub 上正受到 AI 开发者社区的接纳和使用。这些智能体能够适配用户的个人

查看详情
为什么大型 AI 集群需要 Optical Shuffle 架构实现高效扩展
技术文章

为什么大型 AI 集群需要 Optical Shuffle 架构实现高效扩展

大模型训练与AI推理持续向超大规模演进,GPU集群正从万卡迈向十万卡。传统布线已无法满足高密度全互联需求,Optical Shuffle架构通过物理层光通道重排实现扁平化互联,成为超大规模AI网络的核心基础能力。

查看详情
面向800G/1.6T时代,MMC跳线如何重塑AI数据中心互联底座
技术文章

面向800G/1.6T时代,MMC跳线如何重塑AI数据中心互联底座

 在人工智能与高性能计算快速发展的推动下,数据中心正在经历新一轮架构升级。随着新一代CPO(共封装光学)交换机逐步进入商用阶段,以及800G、1

查看详情
释放 GPU 算力极限:VAST “三位一体”架构破局 AI 推理瓶颈
技术文章

释放 GPU 算力极限:VAST “三位一体”架构破局 AI 推理瓶颈

过去几年,AI基础设施的核心矛盾集中在算力供给上:GPU规模、并行效率、训练吞吐。然而,随着大模型逐步进入规模化应用阶段,行业的重心正在从“训

查看详情
Vera 正式登场:NVIDIA 首款专为智能体打造的 CPU,现已入驻顶尖 AI 实验室
技术文章

Vera 正式登场:NVIDIA 首款专为智能体打造的 CPU,现已入驻顶尖 AI 实验室

Ian Buck 亲自将首批 NVIDIA Vera CPU 系统交付至 Anthropic、OpenAI、Oracle Cloud Infrastr

查看详情
能跑测试不等于能跑生产:AI基础设施的真实可用性门槛
技术文章

能跑测试不等于能跑生产:AI基础设施的真实可用性门槛

在数据中心和AI基础设施建设中,“测试通过”往往只验证了受控条件下的基本功能,而生产环境要求的是长期稳定、高负载一致性和故障快速恢复能力。本文分析了为什么“能跑测试”不等于“能跑生产”,以及如何评估基础设施是否真正具备生产可用性。

查看详情
AI 推理工作负载的无损网络建设方案
技术文章

AI 推理工作负载的无损网络建设方案

AI 推理集群对低时延、稳定吞吐和多网络协同提出更高要求。本文围绕计算网络、管理网络和存储网络的分层设计,解析如何构建面向推理工作负载的高性能无损网络。

查看详情
51.2T交换机选型指南:64×800G VS 128×400G,如何构建更适合AI集群的高速网络底座?
技术文章

51.2T交换机选型指南:64×800G VS 128×400G,如何构建更适合AI集群的高速网络底座?

在AI算力爆发的今天,数据中心网络正经历一场从400G到800G的带宽升级。   对于大模型训练、AI推理、云计算平台和智算中心建设而言,网络

查看详情