LLM 网关缓存优化
自建 LLM 网关,支撑日均 20B Token;在网关层、大文件附件与重排序等环节落地 cache hit 优化,降低上游成本与首 Token 延迟。
聚焦 LLM 网关缓存、性能观测与 Agent 沙盒治理三个方向,沉淀可复用的工程经验。
自建 LLM 网关,支撑日均 20B Token;在网关层、大文件附件与重排序等环节落地 cache hit 优化,降低上游成本与首 Token 延迟。
具备比特级请求比对与上千节点分布式 Debug 经验;擅长操作系统 cache 观测与 perf 调优,覆盖 K8s 服务分流与 APISIX 网关 TTFT / ITL 观测。
实现 Agent 沙盒快照与快速恢复、沙盒行为审计与峰值 / 均值内存监控;基于相似任务聚类编排优化,提升批量推理吞吐与资源利用率。
重点不是“会调用模型”,而是把 Agent 做成可治理、可观测、可复用、能承载企业级研发流程的生产系统。
OpenAI/Anthropic 兼容网关,多模型路由与 Claude 别名映射,分时计价、额度管控与 AutoBan,飞书 OIDC + Passkey 登录。
上千条 Agent Skills 的注册、检索与安装市场,公开 API,飞书登录,支撑技能沉淀、复用与共享。
桥接 Claude Code → 自建网关,35+ 项目 Skills 与 Prompt Template,实现群聊即 Agent 的多业务线接入。
项目 / 用户分账、高峰期与上下文长度动态计费,采集 DeepSeek 余额与百度云分账账单,Prometheus 指标驱动降本。
百度云 CCE K8s 1.34 双集群、Terraform、VPC-ENI、JuiceFS,统一出口与安全组白名单治理。
Prometheus / Grafana / Loki / Alloy 全栈可观测,Grafana 告警 → 飞书卡片,服务监控与成本大盘。
从云原生基础设施、分布式构建,到企业级 AI 工程化平台,长期在工程系统的关键路径上做降本增效。
项目选择聚焦“能把复杂工程系统跑起来并长期变好”的能力。
OpenAI/Anthropic 兼容网关,多模型路由与 Claude 别名映射,支撑 Claude Code / Desktop 等客户端接入。
分时计价、额度管控、AutoBan、Passkey 与飞书 OIDC,实现模型用量与成本治理。
上千条 Agent Skills 的注册、检索、趋势与安装市场,提供公开 API 与飞书登录。
支撑技能沉淀与跨团队复用,是 Agent 能力治理与分发的统一入口。
桥接飞书单聊机器人 → Claude Code → 自建网关,35+ 项目 Skills 与 Prompt Template 按需加载。
打通告警、周报、新闻摘要等自动化 Agent 场景,实现群聊即 Agent。
百度云双集群 IaC:VPC-ENI、CDS CSI、JuiceFS、AppBLB 与安全组白名单全量纳管。
统一出口三端口、可观测栈与变更验收,沉淀 35+ 运维 Skill。
完成手动扩容到动态扩缩容改造,落地 CAS/Worker 分离、按 Mnemonic 路由分组和平滑下线机制。
通过任务路由和负载治理降低 70% 构建资源消耗,支撑上千台分布式构建集群稳定运行。
整合 Gerrit、Jenkins、BuildKitd、Bazel 与 Harbor,支撑镜像构建、制品发布与流水线门禁。
带领 10+ 人团队推进研发流程标准化与交付效率。
横跨 AI 工程化、云原生基础设施与可观测性工具链。
持续输出云原生、DevOps、小程序和工程实践内容。
完成校验后展示微信号:加载中...