阿拉斯加大闸蟹
码龄11年
求更新 关注
提问 私信
  • 博客:1,600,386
    社区:180
    1,600,566
    总访问量
  • 329
    原创
  • 1,970
    粉丝
  • 192
    关注
IP属地以运营商信息为准,境内显示到省(区、市),境外显示到国家(地区)
IP 属地:北京市
加入CSDN时间: 2015-07-13

个人简介:JDcloud;ByteDance;XueQiu;YiChe;CATARC

博客简介:

阿拉斯加大闸蟹的博客

博客描述:
https://github.com/singgel/
查看详细资料
个人成就
  • 获得503次点赞
  • 内容获得95次评论
  • 获得1,073次收藏
  • 代码片获得322次分享
  • 博客总排名82,625名
  • 原力等级
    原力等级
    5
    原力分
    1,112
    本月获得
    0
创作历程
  • 3篇
    2026年
  • 24篇
    2025年
  • 13篇
    2023年
  • 5篇
    2022年
  • 49篇
    2021年
  • 56篇
    2020年
  • 47篇
    2019年
  • 59篇
    2018年
  • 56篇
    2017年
  • 41篇
    2016年
  • 2篇
    2015年
成就勋章
TA的专栏
  • network
    19篇
  • AI
    18篇
  • golang
    3篇
  • 单元测试
    6篇
  • day day study day day up
    18篇
  • matric监控
    15篇
  • log日志
    14篇
  • trace链路追踪
    6篇
  • jvm
    28篇
  • Redis
    43篇
  • ElasticSearch
    10篇
  • NLP TensorFlow
    2篇
  • tcp
    9篇
  • java
    48篇
  • maven
    3篇
  • Python go .NET
    9篇
  • SqlServer
    8篇
  • Oracle
    12篇
  • mysql
    19篇
  • linux
    10篇
  • nginx envoy
    14篇
  • netty
    11篇
  • zookeeper
    6篇
  • kafka
    12篇
  • grpc dubbo thrift
    8篇
  • protobuf
    4篇
  • hadoop hive hdfs
    9篇
  • Spring springboot springcloud
    18篇
  • docker k8s servicemesh
    8篇
  • 设计模式
    7篇
  • 前端集锦
    2篇
  • 工具窍门
    9篇
  • 思考感悟
    10篇

TA关注的专栏 0

TA关注的收藏夹 0

TA关注的社区 5

TA参与的活动 0

创作活动更多

【多重好礼】鸿蒙心迹 · 开发录原创征稿活动

鸿蒙开发者的实战经验,值得被记录。从踩坑排查到项目复盘,从工具脚本到学习笔记,每一段真实的开发经历,都是社区最宝贵的技术资产。「鸿蒙心迹 · 开发录」正式启航,不限主题、随时可写,只要是鸿蒙开发相关的真实经验都欢迎投稿。 本活动为 [HarmonyOS 7.0 创新内容共创季](https://builderx.csdn.net/activity-site/harmonyos/activity2026)双轨征文之一,与[「共创季 · 稿事节」](https://harmonyosdev.csdn.net/6a97f0de2b83d06f0ecadec5.html)深度征文互补——「稿事节」写深度技术长文,「开发录」写日常开发实战笔记。 「开发录」每月一期,12月截止,本季共三期,投稿即有机会获得京东卡、CSDN博客流量券、亿万Token、社区定制周边好礼!

258人参与 去参加
  • 最近
  • 文章
  • 专栏
  • 代码仓
  • 资源
  • 收藏
  • 关注/订阅/互动
更多
  • 最近

  • 文章

  • 专栏

  • 代码仓

  • 资源

  • 收藏

  • 关注/订阅/互动

  • 社区

  • 帖子

  • 问答

  • 课程

  • 视频

搜索 取消

记一次Docker/Kubernetes上无法解释的连接超时原因探寻之旅

这个坑本质是Linux内核 + iptables SNAT的古老bug,Kubernetes + Docker/Flannel场景下被无限放大。现在主流方案是,基本杜绝这类幽灵超时。如果你也遇到类似“莫名其妙超时”,欢迎贴日志/抓包,我帮你继续挖🦀🍌!有没有人踩过更奇葩的网络坑?来交流~
原创
博文更新于 2026.01.26 ·
921 阅读 ·
13 点赞 ·
0 评论 ·
7 收藏

智算中心整体网络架构

具体到不同的客户在进行CLOS架构组网时,又会根据实际的情况,对网络结构进行调整,GPU服务器的接入也会区分为多轨接入和单轨接入,我们在后面的案例中,会看到两种接入形式的区别,其中,多轨接入是指GPU 服务器上的8张网卡依次接入8台Leaf交换机,多轨接入方式集群通信效率高,大部分流量经一级Leaf传输或者先走本地GPU服务器机内代理再经一级Leaf传输(如:不同服务器的同轨GPU直接通过直连的Leaf进行传输;不同服务器的不同轨GPU进行通信,先在服务器内转换成同轨通信,再通过直连的Leaf进行传输);
转载
博文更新于 2026.01.22 ·
2552 阅读 ·
1 点赞 ·
0 评论 ·
8 收藏

P4编程理论与实践

本文首先介绍了P4编程语言的基本概念和工作原理。P4是一种用于软件定义网络(SDN)的数据面编程语言,通过定义解析器、匹配动作表和流水线等组件,实现对网络数据包处理的灵活控制。文章详细分析了P4的语法结构,包括Header定义、Parser状态机、Table匹配规则和Action操作等核心元素,并通过basic.p4实例展示了P4程序的完整结构。 其次,文章探讨了DPDK的基本原理和初始化过程。DPDK通过用户态驱动和轮询机制提升网络包处理性能,其核心组件包括EAL环境抽象层、内存管理和多核调度等。作者通过
原创
博文更新于 2026.01.05 ·
1556 阅读 ·
23 点赞 ·
0 评论 ·
14 收藏

DPDK全科普

NUMA来源于微架构,处理器和本地内存之间有更小的延迟和更大的带宽;每个处理器还可以有自己的总线。处理器访问本地的总线和内存时延迟低,而访问远程资源时则要高。DPDK充分利用了NUMA的特点,每个核都有自己的内存,一方面是本地内存的需要,另一方面也是为了cache一致性用本地处理器和本地内存处理本地设备上产生的数据处理器核数(cpu cores):每个物理CPUcore的个数逻辑处理器核心数(siblings):单个物理处理器超线程的个数系统物理处理器封装ID(
原创
博文更新于 2026.01.05 ·
4486 阅读 ·
10 点赞 ·
0 评论 ·
27 收藏

NVDIA 高性能 GPU 服务器硬件拓扑与集群组网

本文系统地介绍了GPU训练集群的硬件架构与互联技术,重点分析了NVIDIA主流GPU服务器的内部拓扑结构。文章首先阐述了PCIe交换芯片、NVLink、NVSwitch等核心组件的工作原理,并对比了不同代际NVLink和HBM的性能差异。随后详细拆解了8卡A100/A800、H100/H800、L40S等典型服务器的硬件拓扑,包括PCIe层级、NVLink互联方式及网络配置方案。文章特别指出L40S机型通过去除NVLink降低了成本,但需要依赖200Gbps网络实现卡间通信。最后介绍了面向中国市场的H20配
转载
博文更新于 2025.10.24 ·
1263 阅读 ·
0 点赞 ·
0 评论 ·
6 收藏

GPU 进阶 华为昇腾 910B GPU 相关

华为昇腾GPU与NVIDIA产品对照解析 本文系统介绍了华为昇腾GPU产品与NVIDIA的对应关系及技术特点。核心内容包括: 术语对照:华为NPU/GPU对应NVIDIA GPU,HCCS类似NVLink,CANN对应CUDA 产品线:训练卡昇腾910B对标A100/A800,推理卡Atlas300对标T4 硬件配置:以8卡910B训练机为例,采用鲲鹏920 ARM CPU、24*64GB内存、200G RDMA网卡,功耗仅4.5KW(x86需12KW) 关键技术:HCCS卡间互连带宽达392GB/s,配套
转载
博文更新于 2025.10.24 ·
1254 阅读 ·
0 点赞 ·
0 评论 ·
1 收藏

NVIDIA GH200 芯片、服务器及集群组网(2024)

摘要:NVIDIA新一代GH200超级芯片将CPU(Grace ARM)、GPU(H200)及内存高度集成,打破传统x86+GPU服务器架构。该芯片通过900GB/s的NVLink-C2C互连,实现624GB统一内存空间和超分显存功能。LPDDR5X内存带宽较DDR5提升53%且功耗降低87.5%,支持144GB HBM3e显存(4.9TB/s)。产品形态包括单卡PCIe节点和32卡全互联NVL32机柜,后者可构建19.5TB内存的AI算力单元。GH200标志着数据中心从CPU中心转向以GPU为核心的异构计
转载
博文更新于 2025.10.24 ·
1692 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

OPPO RDMA 在典型场景下的技术应用

OPPO在典型业务场景中应用RDMA技术的实践与经验总结。文章分析了三种适配场景:机器学习/分布式存储等可直接使用社区成熟方案;RPC类通信需修改接口调用方式;私有通信协议需解耦业务与网络IO。重点以Redis改造为例,详细阐述了如何基于RDMA特性重构网络传输层,包括连接管理、事件处理等核心模块的实现方案,并指出改造过程中的关键点和潜在挑战。文中提出的分层改造思路和具体实现方法,为类似业务系统的RDMA迁移提供了有价值的参考。
转载
博文更新于 2025.10.11 ·
1222 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

[SIGCOMM‘24] R-Pingmesh: A Service-Aware RoCE Network Monitoring and Diagnostic System

R-Pingmesh是首个基于端到端探测的服务感知RoCE网络监控系统,能准确测量网络延迟和主机处理时延,区分网卡与网络丢包,判断问题根源。该系统采用商用RDMA网卡,包含Agent、Controller和Analyzer三个模块,覆盖集群监控和服务跟踪功能。部署测试显示其问题定位准确率达85%,成功检测14类问题,包括硬件故障、配置错误和网络拥塞等。未来研究方向包括适配IB集群、GPU异常检测和自动诊断等。该系统已在数万RNIC上部署,成为RoCE网络关键监测工具。
原创
博文更新于 2025.10.11 ·
2074 阅读 ·
29 点赞 ·
0 评论 ·
31 收藏

快手DHPS 基于RDMA 通信的可负载均衡高性能服务架构

摘要:快手研发的DHPS架构通过创新性改造,构建了国内首个基于RDMA通信的高性能在线服务系统。该架构采用端网协同设计,包含三大核心模块:构建支持AZ级部署的四层网络、自主研发高性能存储引擎和RDMA通信库、实现智能流量调度。存储引擎采用12路CuckooHash索引和SIMD优化技术,查询吞吐提升270%;通信库实现RDMA与TCP自动切换,网络延迟降低35%。整套系统在200节点规模下实现99.999%可用性,存储节点从200台缩减至个位数,机器成本节省70%。该架构不仅支持推荐大模型落地,其基础设施还
转载
博文更新于 2025.10.11 ·
1287 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

[SIGCOMM‘24] Pingmesh: A Large-Scale System for Data Center Network Latency Measurement and Analysis

微软数据中心网络监控系统Pingmesh的设计与实践:通过分层采样和TCP/HTTP探测实现大规模数据中心网络延迟测量与分析。系统采用Controller-Agent架构,Controller生成智能探测列表,Agent执行10s间隔的端点探测并将结果存入Cosmos。通过5min-1天的多粒度分析,实现99.99%延迟在100ms内的SLA监控,并能自动识别交换机静默丢包等故障。相比传统N^2复杂度方案,Pingmesh在微软每日处理2千亿次探测,形成24TB监控数据,为网络故障诊断提供可靠依据。关键设计
原创
博文更新于 2025.10.11 ·
2095 阅读 ·
29 点赞 ·
0 评论 ·
15 收藏

[SIGCOMM‘25] Revisiting RDMA Reliability for Lossy Fabrics

摘要:针对AI算力激增带来的智算网络挑战,华为提出DCP(数据控制分离)技术,重构RDMA可靠性设计。DCP通过区分数据平面(有损)和控制平面(无损),结合交换机Packet Trimming和加权轮询调度,消除PFC依赖,兼容多路径传输。实验显示,DCP在丢包恢复效率上提升1.6-72倍,AI任务完成时间降低42%,支持百公里长距传输。该技术是华为AI原生传输(ANT)方案的关键特性,为大规模智算网络提供高性能传输支持。
原创
博文更新于 2025.10.11 ·
2008 阅读 ·
9 点赞 ·
0 评论 ·
22 收藏

【百度】智能云大规模 AI 高性能网络的设计与实践

百度智能云AIPod高性能网络设计满足大模型训练的三大核心需求:超大规模、超高带宽和超长稳定。针对千亿参数大模型训练所需的分布式并行计算,AIPod采用8通道CLOS架构设计,支持超16K GPU规模,通过无收敛网络拓扑和RDMA技术实现单卡20GB/s的Allreduce带宽。在网络稳定性方面,创新性地采用动态负载均衡、黑盒探测和性能透视平台等技术,将硬件故障影响控制在秒级。实践表明,该网络能支持千卡规模任务持续稳定运行,单卡通信带宽达百G水平。AIPod作为AI大底座的核心组件,显著提升了大模型训练效率
转载
博文更新于 2025.10.11 ·
1291 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

[SIGCOMM‘24] Alibaba HPN: A Data Center Network for Large Language Model Training

阿里云HPN数据中心网络针对大语言模型(LLM)训练进行了优化设计。传统数据中心网络存在负载均衡问题和单点故障风险,无法满足LLM训练的高流量突发性和高可靠性需求。HPN采用去堆叠双上联+双网络平面+大二层架构,通过减少哈希运算次数解决负载不均衡问题,并提升容错能力。单Pod可支持15K GPU,跨Pod支持100K GPU规模,训练性能提升14.9%,故障恢复时间显著缩短。该架构有效解决了LLM训练中的网络性能瓶颈和可靠性挑战。
原创
博文更新于 2025.10.11 ·
2253 阅读 ·
14 点赞 ·
0 评论 ·
23 收藏

弹性 RDMA 的技术解析与实践

摘要: 阿里云推出的弹性RDMA(eRDMA)技术通过复用VPC网络,结合自研拥塞控制算法,实现了高吞吐、低延迟的大规模RDMA组网能力。eRDMA完整兼容现有RDMA生态,支持200Gbps带宽和8μs延迟,适用于AI、HPC等高性能场景。相比传统TCP,eRDMA在Redis、Spark等应用中可提升性能30%-130%。其关键技术包括基于VPC的Overlay RDMA部署、自研CC算法和HPCC拥塞管理,同时保持云服务器的热迁移、热升级特性。测试显示,eRDMA加速Redis性能达TCP的2.46倍
转载
博文更新于 2025.09.10 ·
1790 阅读 ·
0 点赞 ·
0 评论 ·
0 收藏

LSF 作业负载管理

摘要:LSF作业生命周期包含提交、排队、调度、执行和返回结果等阶段。使用bsub命令提交作业时可指定参数修改默认行为,作业需提交到配置了优先级、资源限制等特性的队列中。LSF根据用户权限、节点限制、资源需求等条件自动选择合适队列,并基于队列优先级、公平共享等策略调度作业。节点选择时检查主机负载、资源匹配度等条件,确保在最优节点执行。作业执行时会继承提交主机的环境变量和工作目录。(149字)
原创
博文更新于 2025.09.10 ·
2064 阅读 ·
31 点赞 ·
0 评论 ·
20 收藏

RDMA和RoCE有损无损

拥塞问题:ReactionPoint 响应端(发送方网卡) --------------- Congestion Point 拥塞点交换机 -------------------- NotificationPoint 通知发起方(接收方网卡)
原创
博文更新于 2025.09.10 ·
2087 阅读 ·
3 点赞 ·
0 评论 ·
5 收藏

基于RDMA 通信的可负载均衡高性能服务架构

Embedding Table巨大的存储需求使得这些系统通常采用CPU和GPU异构部署的方式构建. 随着模型参数量剧增, 特别是模型需要捕获用户更长期更丰富的行为, 同时物料Embedding也快速增长时, Embedding Table这些存储节点和GPU推理服务器之间的通信还在使用TCP导致CPU占用率占用高、延迟高、吞吐低等劣势, 严重制约了服务响应时间,限制了模型预估机器的ScaleOut规模.
原创
博文更新于 2025.09.10 ·
2401 阅读 ·
21 点赞 ·
0 评论 ·
14 收藏

基础网络全科普

BGP是什么?BGP是如何工作的?- 华为。
原创
博文更新于 2025.08.06 ·
3533 阅读 ·
22 点赞 ·
0 评论 ·
21 收藏

OVS全科普

除非必要,否则最好将其关闭,因为它可防止来自子网络的用户采用 IP 地址欺骗手段,并减少 DDoS (分布式拒绝服务)攻击的机会。后,二层的网桥在转发包时也会被iptables的FORWARD规则所过滤,这样有时会出现L3层的iptables rules去过滤L2的帧的问题(见。#OVS的术语解释(https://typesafe.cn/posts/ovs-learn-1/)ovs-vsctl add-br br-int #添加网桥。ovs-vsctl del-br br-int #删除网桥。
原创
博文更新于 2025.08.06 ·
3971 阅读 ·
9 点赞 ·
0 评论 ·
12 收藏
加载更多