标签

工程效能

从默认放行到零信任:用 Kubernetes NetworkPolicy 隔离三层应用

来源: postgr.es 21
Kubernetes 集群中的 Pod 通常可以彼此通信。部署了 Frontend、Backend 和 Database,并不意味着三层之间天然存在网络边界。要实现零信任,需要先把命名空间切换为默认拒绝,再基于标签、端口和方向逐条开放业务真正需要的链路。 NetworkPolicy 是标准 Kubernetes API,但 API 对象本身不会拦截数据...

ip2region 3.18.0:数据更新与 C++ Windows 集成指南

来源: oschina.net 30
ip2region 3.18.0 的重点是数据更新,以及对 C++ Windows 环境的支持。对于需要在内网、边缘节点或低延迟服务中完成 IP 定位的团队,这次更新的价值不只是“能在 Windows 上编译”,还意味着同一套 xdb 数据和查询逻辑可以覆盖更多部署环境。 ip2region 是一个离线 IP 数据管理与定位框架,同时支持 IPv4、I...

让 AI Agent 走出 Demo:用仿真测试和自动评估构建生产级可靠性

来源: infoq.com 30
很多 AI Agent 在演示环境里表现惊艳,进入真实业务后却很快暴露问题:用户不会按预设路径提问,工具会返回异常数据,多轮对话会逐渐偏离目标,合规边界也可能在长链路中被突破。真正的难点不是让 Agent 完成一次成功任务,而是持续证明它在大量未知场景下仍然可靠。 来源分享的核心思路是把 Agent 测试从人工抽查升级为“仿真驱动测试”:用合成用户画像...

给反爬网关装上 WebAssembly:Anubis 一年工程化复盘

来源: oschina.net 25
WebAssembly 进入一个反爬网关,并不是把一段 Rust 编译成 就结束了。Anubis 为工作量证明加入 WebAssembly 的过程,经历了几百个 commit、五代 PR、几十个测试,还包括部分 Rust 重写、编译器 bug,以及至少三次把开发机内存跑爆。这个故事的价值,在于它展示了一个看似局部的性能或兼容性改动,怎样变成跨语言、跨运...

Blume:把 Markdown 目录直接变成 AI 友好的文档站

来源: infoq.com 30
搭建文档站经常不是难在写内容,而是难在维护脚手架、导航、SEO、构建配置和迁移工具。Blume 试图缩短这条链路:只需要 Node.js 和一份 Markdown 文档,就能从内容目录生成完整网站。它基于 Astro 与 Vite,既保留静态内容的简单性,也为后续定制和工程化构建留下空间。 传统文档系统通常要求团队先选择主题、编写站点配置、维护路由,再...

Kubernetes v1.37:KubeletInUserNamespace Beta 化,Rootless 节点走向生产

来源: kubernetes.io 47
Kubernetes v1.37 将 特性门控提升到 Beta,并默认开启。这个变化不会自动把现有集群变成 rootless 集群,但它标志着 Kubernetes 节点组件以非 root 用户运行的方案已经从长期实验阶段进入更稳定的使用阶段。 Rootless 模式的核心目标很明确:即使 kubelet、CRI、OCI runtime、CNI 插件或...

用弹性 VM 与跨可用区调度提高 Spark 集群创建成功率

来源: cloud.google.com 39
对持续运行的大规模分析平台来说,Spark 作业能否按时开始,往往不只取决于代码和数据,还取决于指定规格的虚拟机当时是否有库存。固定机型、固定可用区的配置看似确定,遇到区域容量波动时却可能让整个数据管道停在集群创建阶段。 Yahoo 在 Google Cloud Managed Service for Apache Spark(原 Dataproc)中...

用 Antigravity CLI 批量改造 DAO:把 Spanner 双写迁移变成可验证的流水线

来源: cloud.google.com 38
数据库迁移真正棘手的部分,往往不是把历史数据复制到新库,而是在生产服务持续处理请求时,让新旧存储长期保持一致。Google 财务工程团队在迁移到 Spanner 时,需要为 30 多个 DAO 补齐转换器、双写分支、错误处理和单元测试。逐个手工修改不仅耗时,还容易在时间戳、空值和字段映射上产生细微偏差。 他们采用的办法,是先把迁移模式标准化,再通过 A...

TPU 上的 LLM 推理为何会撞墙:Gemma 3 分类与生成负载实测解析

来源: cloud.google.com 39
把大语言模型从实验环境搬到生产系统后,模型参数量并不能单独决定吞吐和成本。同一套 TPU、同一个服务框架,面对“长输入、短输出”的分类请求和“短输入、长输出”的生成请求,可能呈现完全不同的扩展曲线。 这组测试在 Google Cloud TPU v6e 上运行 Gemma 3 12B 与 27B,使用 GKE Autopilot、单主机 2×2 TPU...

别只盯着 GPU:生产级 AI 平台是一套异构计算系统

来源: cncf.io 29
谈到 AI 基础设施,GPU 往往最先进入讨论:需要多少张卡、显存多大、训练吞吐是多少。但生产工作负载并不是把张量送入 GPU 就结束了。数据读取、解压、清洗、分词、请求编排、结果后处理和可观测性通常运行在 CPU 上,并持续依赖内存、网络与存储。平台工程真正要解决的,是这些资源如何协同,而不只是如何分配加速卡。 一条典型的推理链路可以拆成以下阶段: ...