CI/CD · DevOps 全栈研发 · 效率研发基建 · 分布式集群调优

效率研发基建 · 底层分布式集群调优

5 年云原生与 DevOps 全栈研发经验,覆盖私有云到公有云、源码到内核。把构建、发布、出口、缓存与可观测性做成可复用平台:统一构建缓存把 test / prod 部署压到 80s / 110s(SLA ≤300s);百度云 CCE Kubernetes 1.34 双集群 16/16 节点 Ready;自建 LLM 网关统一路由 DeepSeek / 智谱 GLM / 百度千帆,8 小时单模型消耗 975M token。

在线简历 · https://l1.fit
查看项目 下载 PDF

个人核心优势

六条主线:把超大规模构建集群运维得稳定高效、把网络与流量变成可定位的观测面、把研发链路做成可复用平台、把线上状态全部收敛到 IaC、把硬件与带外管理纳入日常运维、把 Agent 能力做成可弹性伸缩的生产系统。

超大规模构建集群 · 深度排障

华为云云龙 DevOps 超大仓分布式编译(昇腾 / 鸿蒙):构建 CAS 800T,缓存命中 95%+ 时仍占 2 万核 / 40 TB,相当于节约 38 万核 CPU / 760 TB 内存;独立运维单集群 上千节点,Bazel 分布式编译集群资源消耗降低 70%

深度排障:定位重复文件下载与重复构建并增加 fastpath,缩短构建时间 70%;QEMU 逐行 debug 内核启动;perf / strace 跨层定位。源码级经验横跨 K8s 与 OpenStack,覆盖分布式 CSI 快照与克隆、极速快照、COW 与 dentry / dcache。

网络与流量可观测

网络知识覆盖从单机网络堆栈到交换机:iptables / nftables、WireGuard、tcpdump、eBPF 与 K8s Calico 网络模型,能顺着内核协议栈、转发面到交换机逐层定位连通性与丢包问题。

自研流量可观测与流量镜像分析等 debug 组件,用于出口链路、跨集群互通与转发异常的现场定位与状态回读。

效率研发基建 · CI/CD 全栈

GitLab CE / Runner 治理与单 Job 部署契约(validate→build→publish→deploy→verify→cleanup),工具链版本由 versions.env 单点锁定。

基于 Bazel / BuildBarn / ccache 落地分布式增量构建缓存,优化 CMake / Maven 构建链路。

Agent 弹性计算

Agent 沙箱快照与快速恢复、容器化沙箱、任务编排与并发限流;把批量推理、异步队列、失败重试做成可调度能力。

自建 LLM 网关支撑 Claude Code / Desktop 等 Agent 客户端规模化接入,本人为重度用户:8 小时单模型消耗 975.20M token(≈1B),近 7 天网关可监控口径 8.44B token;另有多套未接入网关监控的 Codex 账户在用,实际消耗高于此数。

SRE · IaC 全量纳管

线上全部由 IaC 表达:174 个注册组件(Terraform 26 / K8s 107 / Helm 3 / 主机 38),覆盖 2 个 CCE 集群、5 台 BCC、7 个 /24 子网、9 个 AppBLB、22 个安全组与 119 条规则、7 个 BOS 桶。

iac diff / apply --exact 逐组件回读,terraform plan / kubectl diff / helm template 三类判据给出 0 / 2 退出码——repo↔live 零漂移才算完成,线上不留未纳管资产。

硬件与带外管理

交换机侧做 VLAN 划分、链路聚合与端口镜像(镜像流量直接喂给自研流量分析组件),排障从 MAC 表、光模块一路查到链路误码。

服务器侧用 IPMI / Redfish 做带外管理:远程开关机与 KVM、传感器与 SEL 日志判读、BIOS / BMC 固件升级;硬盘与 RAID 故障同样从 SEL 与 dmesg 入手定位。

有趣探索

排障与折腾:根因往往在更深的一层,好玩的东西往往自己动手做。

QEMU 逐行 debug 内核启动

用 QEMU 单步跟踪引导链与内核初始化,定位内核启动失败的根因,并打通 debug 流量发送 链路。

这类问题没有现成答案,靠的是对启动流程、内存布局与硬件初始化顺序的完整理解。

libc / libc++ 段错误定位

崩溃栈落在 libc / libc++,根因却在上层软件的非法调用。顺着调用栈回溯到真正的调用方,核对参数约定与对象生命周期,最终从业务侧规避,而不是去改标准库。

难点在于:栈顶只是受害者,不是肇事者——定位必须穿透到真正的调用方。

私有云除零与硬件级故障

从 dmesg 里区分软件除零与硬件异常,确认是硬件问题后联合厂商复现故障、定位根因,最终通过升级 flash 固件解决。

软件日志只能给线索,硬件问题要和厂商一起收敛到可复现的最小现场。

为 NFS CSI Driver 增加快照与克隆

在 NFS CSI 驱动上补齐 VolumeSnapshot 与卷克隆能力,把原本缺失的存储特性接进 K8s 存储链路。

涉及 CSI 接口契约、external-snapshotter 协作与底层卷语义的一致性设计。

自研硬件小盒子

ESP32 蓝牙配网盒子:不用串口、不用改固件,手机端即可完成设备联网,把「设备怎么连上网」从工程操作变成普通人也能完成的动作。

AI 语音盒子:端侧拾音 + 云端大模型推理,把语音入口做成能摆在桌上的实体设备——和自建 LLM 网关是同一套思路。

WireGuard 跨城组网小盒子

把北京、武汉、长沙三地的设备组进同一内网:重编 ARM 内核启用 WireGuard 内核模块,单台成本约 50 元

用来验证一件事:跨城组网不必依赖商业方案,内核能力用对了就够了。

AI 消耗量

自建 LLM 网关 new-api「模型统计」真实读数(本人日常开发场景)。8 小时窗口内单模型消耗 975.20M token、峰值吞吐 288.7 t/s;近 7 天 8 个(渠道、模型)组合合计 8.44B token。以上只是自建网关能监控到的那一部分——另有多套未纳入网关监控的 Codex 账户同时在用,实际消耗高于此数。

975.20M单模型 8h Token(deepseek-v4.1-flash-exp)
288.7 t/s8h 峰值吞吐
97.9%8h 缓存命中率(DeepSeek 渠道)
≈8.44B近 7 天总 Token(09-09 读数,网关可监控口径)
new-api 模型统计页面,周期 8h:deepseek-v4.1-flash-exp 975.20M token、288.7 t/s、缓存命中率 97.9%;glm-5.3-flash(baidu)246.36M;glm-5.3-flash(zai)15.11M 等
周期 8h:deepseek-v4.1-flash-exp 975.20M token / 288.7 t/s / 缓存命中率 97.9%;deepseek-v4-pro 3.47M(97.8%);glm-5.3-flash(baidu)246.36M(74.1%);glm-5.3-flash(zai)15.11M(60.1%);7 行合计约 1.24B token。
new-api 模型统计页面,周期 7d:glm-5.3-flash(baidu)3.39B token、deepseek-v4.1-flash-exp 1.55B、deepseek-v4-pro 1.47B、deepseek-v4-flash-vision 1.39B、glm-5.3-flash(zai)618.51M 等 8 行
周期 7d(09-09 读数):glm-5.3-flash(baidu)3.39B token(缓存命中 49.1%);deepseek-v4.1-flash-exp 1.55B(96.7%);deepseek-v4-pro 1.47B(96.7%);deepseek-v4-flash-vision 1.39B(97.1%);glm-5.3-flash(zai)618.51M(88.5%);8 行合计约 8.44B token。

口径说明:以上仅为自建网关可监控到的部分——另有多套未接入网关监控的 Codex 账户同时在用,实际消耗高于该数。缓存命中率的差异来自渠道本身:百度渠道 49.1%,DeepSeek 渠道稳定在 96.7% 以上,这也是后面对「LLM 缓存失效」做逐渠道加权比对、并定位到动态预算提醒与尾部缓存断点的起点。

工程理念

驱动我做基建的三条判断:速度是效率,可观测深度决定速度上限,治理标准靠工具强制而非人自觉。

构建速度即产品迭代速度

软件构建速度直接影响产品迭代效率:编译与 CI 的每一秒,都会乘以团队人数和每天的提交次数,最终体现在产品的迭代节奏上。

所以我把它当成可量化的工程指标来做——统一构建缓存、增量构建、部署契约与 SLA 门禁,而不是「差不多能跑就行」。

车灯效应

车灯照射的距离,决定了你能开多快:照得远才敢加速;只照亮眼前几米,就只能慢行。

工程系统同理——可观测的深度,决定团队能安全推进的速度上限。所以我先把回读、对账、回滚做扎实,再谈提速。

大型 monorepo 治理

日均 5,000+ PR 的仓库,靠人自觉守不住标准:统一构建、增量缓存、原子提交与可回滚发布,都必须由工具强制。

把这条当作默认工程约束——单 Job 部署契约、增量构建缓存、统一制品源,都是这条理念的落地形态。

核心成果

重点不是「会调用模型」,而是把构建、发布、出口、缓存、观测与 Agent 做成可治理、可复用、能承载企业级研发流程的生产系统。

统一构建缓存与镜像体系

BuildKit registry 远程缓存跨 daemon 复用(空节点 export 后另一 daemon 免密 import 全层 CACHED);test / prod deploy job 实测 80s / 110s,单组件缓存约 381 MiB

统一出口与三级缓存

Nexus 作唯一持久制品源(proxy store 抽样 6,213 blob / 1.55 GB),JuiceFS S3 网关压测单文件 716 MB/s、双文件 1.325 GB/s;自研 Go 出口数据面 + nftables 透明拦截 13 条路由。

自建 LLM 网关(三协议 · 三渠道)

同一入口暴露 OpenAI Chat / Responses / Anthropic 三协议,统一路由 DeepSeek、智谱 GLM、百度千帆,Claude 别名链式映射;百度渠道单日 6,486 请求 / 7.63 亿输入 token

LLM 缓存失效定位

三家上游 × 两协议 × 每组 5 轮对照:去首轮加权命中率百度 24.999% vs zai 99.996% vs DeepSeek 99.675%;根因为动态预算提醒与尾部缓存断点,网关侧修复后旧客户端由 0% 恢复至 99.7%

可观测与告警栈

自建 Grafana 13.1.3(29 个看板 / 610 个面板,2026-09-09 回读)、Prometheus 3.13.2(41 个 scrape job、69 条告警 + 57 条 recording 规则)、Loki 日志;看板由脚本 diff 推送、变更零重启,告警经 Go webhook 机器人推送至飞书群。

数据采集平台

管理 8 台采集节点、每台 10 路并发,If-None-Match:* 幂等 + 64MiB 分片断点续传;Go 482 项测试 + race 437 项 + E2E 全绿,8/8 台对象 HEAD 200 且长度逐字节相等。

工作经历

从云原生基础设施、分布式构建与存储,到企业级 AI 工程化平台,长期在工程系统的关键路径上做降本增效。

某具身智能企业 2026.08 - 至今 AI 工程化平台 / 效率研发基建负责人

统一构建缓存 · 统一出口 · LLM 网关 · 可观测 · 数据采集

  • 建设统一构建缓存与镜像体系:BuildKit registry 远程缓存跨 daemon 复用,test / prod 部署耗时 80s / 110s(SLA ≤300s),单组件缓存约 381 MiB;工具链版本由 versions.env 单点锁定。
  • 设计三级统一缓存与统一出口:Nexus 作唯一持久制品源,JuiceFS S3 网关压测单文件 716 MB/s、双文件 1.325 GB/s;自研 Go 出口数据面 + nftables 透明拦截 13 条路由,Squid 五入口收敛为三端口。
  • 治理百度云 CCE Kubernetes 1.34 双集群:ci-01 16/16 节点 Ready,10.30.0.0/16 VPC 七子网跨四可用区;buildkitd 专用节点 + 300Gi xfs 缓存盘按容量 LRU GC。
  • 自建 LLM 网关(new-api 定制 fork):同一入口暴露 OpenAI Chat / Responses / Anthropic 三协议,统一路由 DeepSeek / 智谱 GLM / 百度千帆,Claude 别名链式映射;百度渠道单日 6,486 请求 / 7.63 亿输入 token。
  • 实现计费与账号治理:billing_mode=tiered_expr 工作日高峰分时计价(DeepSeek 16/16 模型回读生效),Logto OIDC(PKCE S256 + JWKS)与 Passkey 登录;HA 迁移 600 秒探针 513/513 成功、零中断。
  • 定位并修复 LLM 缓存失效:三家上游 × 两协议 × 每组 5 轮对照,去首轮加权命中率百度 24.999% vs zai 99.996% vs DeepSeek 99.675%;定位到动态预算提醒 system 消息 + 尾部缓存断点,修复后旧客户端由 0% 恢复至 99.7%。
  • 建设可观测与告警栈(Grafana / Prometheus / Loki / Alloy + 飞书告警)与数据采集平台(8 台节点、每台 10 路并发、幂等分片上传、Ed25519 签名自升级)。
轻舟智航 2025.04 - 2026.08 AI Agent DevOps 平台负责人

合规云 · CI / 构建系统 · Agent 调度平台 · 分布式编译

  • 服务奇瑞、吉利、理想等多家头部车企:从零建设合规云与 CI + 构建系统,支撑每天 上千个仿真测试版本 的发布,获甲方高度认可并收到其 offer。
  • 独立搭建 Agent 云平台,接入企业飞书群聊机器人,支持不同群 / 机器人绑定独立 Prompt Template、Skills/MCP、工具权限与任务模板。
  • 设计 Agent Task 编排与调度能力,覆盖 Cron 定时触发、批量化推理、在线交互、异步队列、失败重试、并发限流与容器化沙箱。
  • 研发并调优大规模分布式编译集群,基于负载动态扩缩容与任务路由降低 70% 构建资源消耗;实现 CAS/Worker 分离、按 Mnemonic 路由分组与平滑下线机制。
  • 打通飞书外接 Claude SDK Agent 服务:连通研发业务数据读取与服务调用路径,24 小时高准确率定位疑难研发问题,为 500+ 车企研发大群提供 oncall 支持。
  • 日常单人运维上千台分布式构建集群,并对集群调度框架进行二次开发、定制优化和稳定性治理。
  • 建设 Skills/MCP 分层管理和插件市场,用户可创建 Task Template 并导入共享配置,降低 Agent 工作流复制、治理和升级成本。
  • 为企业持续提交数百个性能优化、依赖裁剪与工程治理 MR,覆盖构建耗时、镜像体积、运行依赖、CI 稳定性与代码质量门禁。
九维数智(北京)科技有限公司 2024.02 - 2025.04 云原生研发工程师

分布式 CSI 存储 · 快照与 COW · CI/CD · 研发流程治理

  • 为 NFS CSI Driver 增加 快照(VolumeSnapshot)与卷克隆 特性,负责 K8s CSI 驱动与 Operator 二次开发,保障存储层高可用与自动化运维。
  • 参与分布式 CSI 存储链路优化,涉及极速快照、COW(写时复制)与 dentry / dcache 目录遍历路径,降低快照与元数据操作时延。
  • 建设 LDAP 成员管理与 Code Review 服务,完善权限精细化管控和研发流程治理。
  • 构建 CI/CD 平台,整合 Gerrit、Jenkins、BuildKitd、Bazel 与 Harbor,支撑镜像构建、制品发布和流水线门禁。
  • 带领 10+ 人研发团队推进研发流程标准化,提升项目交付效率与平台稳定性。
自由职业 2023.01 - 2024.02 独立开发者

抖音 / 微信小程序开发

  • 独立设计并开发抖音、微信小程序,负责需求分析、前后端开发、上线运营与迭代维护。
华为云计算技术有限公司 2022.03 - 2022.12 分布式构建系统研发

华为云 · 云龙 DevOps · 高性能分布式编译 · Bazel · BuildBarn

  • 参与华为云云龙 DevOps 高性能分布式编译系统研发,服务 昇腾、鸿蒙 两个超大仓库源码构建;构建 CAS 缓存 800T,缓存命中 95%+ 时仍占用 2 万核 CPU / 40 TB 内存,相当于节约 38 万核 CPU / 760 TB 内存
  • 定位重复文件下载与重复构建问题并增加 fastpath 快速路径,缩短构建时间 70%,助力团队获得总裁嘉奖令。
  • 基于 Bazel、BuildBarn、ccache 落地分布式增量构建缓存,优化 CMake / Maven 等构建链路。
  • 与欧洲团队协作,参与 justbuild 开源项目;绩效优秀,晋升 1 级,获评“最强软件新生”。
武汉泽塔云科技股份有限公司 2021.09 - 2022.03 云计算研发工程师

OpenStack 私有云 · SPICE 虚拟桌面

  • 参与 OpenStack 私有云平台二次开发与运维,支撑私有云基础设施建设、交付和问题排查。
  • 参与 SPICE 虚拟桌面研发,通过 QEMU 逐行 debug 定位内核启动问题,具备内核级问题定位能力(strace、perf、overlayfs 与容器根文件系统构建)。

核心项目

以下项目聚焦同一件事:把复杂工程系统跑起来,并让它长期变好。

车企合规云与 CI / 构建系统(从 0 到 1)

合规云 · CI/CD · 构建系统 · 仿真测试版本发布

服务奇瑞、吉利、理想等多家头部车企:从零建设合规云与 CI + 构建系统,支撑每天 上千个仿真测试版本 发布。

交付获甲方高度认可,并收到甲方 offer。

超大仓库分布式编译加速(昇腾 / 鸿蒙)

华为云 · 云龙 DevOps · Bazel · BuildBarn · CAS · fastpath

服务 昇腾、鸿蒙 两个超大仓库源码构建:构建 CAS 缓存 800T,缓存命中 95%+ 时仍占用 2 万核 CPU / 40 TB 内存,相当于节约 38 万核 CPU / 760 TB 内存

定位重复文件下载与重复构建问题并增加 fastpath 快速路径,缩短构建时间 70%;助力团队获得总裁嘉奖令。

统一构建缓存与镜像体系

BuildKit 0.30.0 · GitLab CI · CCR registry cache · cache mount

2026-08-25 全链路验证通过并上线 prod:空节点 export 后另一 daemon 免密 import 全层 CACHED,实现跨 daemon 构建缓存复用。

test / prod deploy job 实测 80s / 110s(SLA ≤300s),单组件单 tag 缓存约 381 MiB;工具链版本由 versions.env 单点锁定。

分布式增量构建缓存

Bazel · BuildBarn · ccache · BuildKit registry cache

华为 CloudBuild 时期基于 Bazel / BuildBarn / ccache 做分布式增量构建缓存,优化 CMake / Maven 构建链路;现网延续同一思路做 BuildKit registry 远程缓存跨 daemon 复用。

两条链路共同点:把「哪些产物可以复用」判断清楚,再把缓存做成可跨节点、可回读、可回滚的一等公民。

统一出口与三级缓存架构

Go stdlib · nftables · Squid 三端口 · Nexus · JuiceFS CE 1.3.0

自研 Go 统一出口数据面承载 4 个代理口与 13 条透明出口路由;出口由 Squid 五入口重设计为三端口,3129/3127 退役。

Nexus 作唯一持久制品源(proxy store 抽样 6,213 blob / 1.55 GB),JuiceFS S3 网关压测单文件 716 MB/s、双文件 1.325 GB/s。

自建 LLM 网关(new-api 定制 fork)

Go · React 19 · PostgreSQL · tiered_expr · Logto OIDC + Passkey

同一入口暴露 OpenAI Chat / Responses / Anthropic 三协议,统一路由 DeepSeek、智谱 GLM、百度千帆,支持 Claude 别名链式映射。

百度渠道单日承载 6,486 请求 / 7.63 亿输入 token;HA 迁移 600 秒探针 513/513 成功零中断,常规蓝绿切换零 502/503/504。

LLM 缓存失效定位与供应商级排查

固定 IP 直连 · body SHA256 比对 · token 加权口径 · 双协议矩阵

三家上游 × 两协议 × 每组 5 轮对照:百度去首轮加权 24.999%(OpenAI)/ 24.949%(Anthropic),对比 zai 99.996% / 99.797%、DeepSeek 99.675% / 99.824%。

定位根因(动态预算提醒 system 消息 + 尾部缓存断点)并在网关侧修复,修复后旧客户端由 0% 恢复为 0 / 99.72 / 99.35 / 99.97%,真实 Desktop 会话实测命中 99.627%。

可观测与告警栈

Prometheus 3.13.2 · Grafana 13.1.3 · Loki 3.7.6 · Alloy · 飞书告警

29 个看板 / 610 个面板、41 个 scrape job、69 条告警 + 57 条 recording 规则,看板目录由脚本推送、变更零重启。

告警经 Go webhook 机器人推送到飞书群「sre告警」,critical 抑制同维度 warning,每日 02:00 投递统一巡检卡片。

数据采集平台(bot-gateway-collection)

Go agent · BOS S3 分片上传 · Ed25519 自升级 · Kubernetes

管理 8 台采集节点,每台 10 路并发,上传以 If-None-Match:* 保证幂等,≥64MiB 文件按 64MiB 分片断点续传。

验收覆盖 Go 482 项测试 + race 437 项 + PW E2E 18/18 + API E2E 8/8;8/8 台对象 BOS HEAD 200 且长度与任务 sizeBytes 逐字节相等。

云原生双集群 IaC(sreiac)

Terraform · CCE Kubernetes 1.34 · VPC-ENI · CDS CSI · scripts/iac

10.30.0.0/16 VPC 内 7 个 /24 子网跨 4 可用区,ci-01 集群 16/16 节点 Ready,BuildKit 缓存 PVC 200Gi Bound/Retain。

iac diff 作为 repo↔live 零差异的全局底线,盘点并归组 115 项 unassigned 云资源(BCC 21 / CDS 66 / EIP 6 / AppBLB 23 / BOS 8)。

GitLab CI/CD 平台与 Runner 治理

GitLab CE · GitLab Runner · BuildKitd · 单 Job 部署契约 · 质量门禁

单仓流水线 409 行 / 17 个 job,deploy 契约在单 Job 内完成 validate→build→publish→deploy→verify→cleanup。

Deploy Runner 收敛为单一 #3(并发 5)并下线 #1,跨环境无状态复用释放 2 台 BCC;GitLab 监控首屏热门请求 458.79K→909.14、P95 1.82s→469.50ms。

作品展示

自建平台的真实界面与架构图:服务导航、监控看板、采集链路、只读 AI 助手,以及两张按现网实时数据生成的架构 / 部署图。截图均来自线上环境,只读页面。

SRE 服务部署全景:办公网/公网 → APISIX 网关 → ci-01 与 datainfra-01 两个 CCE 集群(32 个服务入口)→ 统一出口 proxy-gateway → 公网;下方为 8 台采集节点 → bot-gateway → BOS → Grafana 的采集链路
全量服务部署图:32 个服务入口、2 个 CCE 集群(ci-01 56 个工作负载 / datainfra-01 31 个)、174 个 IaC 组件。按业务域与环境分组,入口统一走 APISIX,出口统一走 proxy-gateway 三端口,底部是采集链路。图由服务导航 catalog API 的实时数据生成。
服务导航页面:按业务域与环境列出 32 个服务入口,含 Foxglove、Lichtblick、数据湖生产前端、人员管理生产前端、用户中心生产 API、Logto 生产签发端点等
服务导航:把 32 个服务入口按业务域 × 环境编排,每张卡片给出用途、运行集群、访问方式与账号要求;数据以声明式 catalog 为唯一事实源,IaC 与运行期双向对账。
Grafana「数据采集 · 机器人网关」看板:在线采集节点、周期内成功上传文件 2k、成功上传数据 1.17 TiB,以及每台机器的上传速率曲线与上传总量 / 文件数表格
Grafana 监控看板:29 个看板 / 610 个面板之一(数据采集 · 机器人网关)。周期内成功上传 1.17 TiB,每台机器的平均 / 峰值速率、总量与文件数逐台可查;看板由脚本 diff 推送,变更零重启。
机器人网关采集监控页:待上传文件数 937、待上传文件大小 822.3 GB、预估上传时间 19 小时 31 分、采集节点总数 8、真实上传总量 1.2 TB、瞬时上传速率 11.3 MB/s
采集监控:8 台采集节点的待上传积压、预估完成时间与真实上传速率;真实上传与演练数据分开计数,未盘点时显式标 unknown 而不是伪装成 0。
采集数据自动上传架构图:采集机(8 台,systemd)的业务根目录 → collection-agent(扫描 / 准入 / 路由 / 上传);agent 通过 HTTPS 心跳、任务上报与配置长轮询连到云端控制面 bot-gateway-collection(K8s),并通过 SigV4 直传对象存储 BOS;控制面接 Prometheus → Grafana
数采架构设计:采集机常驻签名 agent,业务文件从物理网卡直连 BOS 不经网关;控制面只下发配置与签名发布清单,Prometheus → Grafana 观测积压与速率。完整设计(准入窗口、读租约、幂等分片、Ed25519 自升级)见飞书《采集数据自动上传 — 架构说明》。
服务导航内置 AI 问答:提问「请你计算 200! 的答案」,助手返回 375 位精确值并给出位数与末尾零的校验,并说明自己只读、不会执行任何变更操作
只读 AI 助手:基于代码库、集群与飞书文档回答研发问题,明确声明只读、不执行变更;问答与导航同一入口,回答里给出可核对的推导与来源。

专业技能

横跨效率研发基建、超大规模构建集群调优、SRE / IaC、网络与硬件运维、AI 工程化平台。

编程语言Go(主力,标准库优先) · Python · TypeScript / React 19 · Shell · C
CI/CD 与 DevOpsGitLab CE / Runner · 单 Job 部署契约(validate→build→publish→deploy→verify→cleanup) · 灰度与回滚 · 质量门禁 · 自动化工具建设
系统与内核strace / perf 跨层定位 · overlayfs 与容器根文件系统 · dentry / dcache 路径优化 · COW 写时复制 · QEMU 逐行 debug 内核启动
网络与流量交换机(VLAN / 链路聚合 / 端口镜像) · 单机网络堆栈 · iptables / nftables · WireGuard · tcpdump · eBPF · K8s Calico 网络模型 · 自研流量可观测与镜像分析组件
SRE 与 IaCTerraform(BCC / VPC / CCE / BOS / AppBLB / EIP / DNS,26 个模块) · iac diff / apply --exact 逐组件漂移回读 · Kustomize / Helm · 主机侧 systemd + reconcile 脚本 · IPMI / Redfish 带外管理(KVM、SEL 日志、固件升级)
构建与打包分发BuildKit / BuildKitd 0.30.0 · registry 远程缓存 · 分布式增量构建缓存(Bazel / BuildBarn / ccache) · Dockerfile 分层与 cache mount · 镜像归档与不可变 tag · versions.env 单点锁定
容器与编排Kubernetes 1.34(CCE 双集群) · StatefulSet / 反亲和 / PDB · 蓝绿双槽与 preStop 优雅排空 · nftables 透明 REDIRECT · Helm / Kustomize
存储与快照分布式 CSI · CDS CSI(含 StorageClass 调优) · 极速快照 · COW 写时复制 · dentry / dcache 优化 · JuiceFS
云基础设施百度云 BCC / CCE / BOS / CDS / CCR / AppBLB / EIP · Terraform · 10.30.0.0/16 VPC 七子网 · 阿里云 ECS + acme.sh DNS-01
缓存与制品Nexus 2-0(工具原生 mirror,唯一持久制品源) · Squid / go-proxy 三端口出口 · JuiceFS CE 1.3.0 S3 网关 · 15 字段访问日志
可观测性Prometheus 3.13.2 · Grafana 13.1.3 · Loki 3.7.6 · Alloy · Alertmanager · blackbox · 自研 Go exporter · 飞书告警卡片
AI / LLMnew-api 定制 fork · 三协议(OpenAI Chat / Responses / Anthropic) · DeepSeek / 智谱 GLM / 百度千帆多模型路由 · Claude 别名链式映射 · tiered_expr 分时计价 · LLM 缓存命中诊断
Agent 平台Agent 沙箱快照与快速恢复 · 容器化沙箱 · Skills/MCP 与 Prompt Template · 飞书群聊机器人 · Claude Code / Desktop / OpenCode
安全与凭据Logto OIDC(PKCE S256 + JWKS) · Passkey / WebAuthn · AES-GCM state.enc · Ed25519 签名自升级 · mTLS 内网域名
公益项目 · 非商业

云智 AI 学堂:让每个人,都能用好 AI

面向零基础用户的免费中文 AI 自助课程——不会写代码也能上手,每天 30 分钟,从第一次对话到完成真实工作。34 节通用课,覆盖学生、文员、财务与行政场景;目标是让 AI 的门槛低到「我也可以」。

访问 ai.yzbx.tech →
云智 AI 学堂首页:你与 AI 的第一课,从「我也可以」开始;零基础友好、每天 30 分钟、34 节通用课